新浪AI前沿速递
DeepSeek V4-Flash的编程能力相比前代提升了多少?
一、量化跃升:跑分数据揭示编程能力质变
代码专项测试 DeepSWE:V4-Flash正式版得分从预览版的7.3飙升至54.4,暴涨超645%,成为该测试中轻量模型的最佳成绩之一。
终端操作能力 Terminal Bench 2.1:得分从61.8提升至82.7,逼近当前最强模型Claude Opus 4.8的85分水平,而V4-Flash的激活参数仅13B。
全栈开发 DSBench-FullStack:得分从37.0增长至68.7,几乎翻倍,表明模型在完整工程项目中的编码和调试能力显著增强。


二、技术解码:后训练驱动的能力暴涨
零架构改动:V4-Flash正式版的总参数2840亿、激活参数130亿,模型架构与预览版完全一致,所有提升均来自重新进行的后训练优化。
强化学习打磨:通过高质量强化学习,模型在工具调用、代码生成、任务拆解等Agent能力上实现了数倍提升,甚至超越了自家V4-Pro预览版。
实测效率对比:开发者实测显示,同一高难度任务V4-Flash仅用40秒完成,而GPT-5.6 Sol需1分47秒,速度优势极为明显。
三、实际表现:开发者眼中的可用性
代码代理体验:接入Agent工具后,V4-Flash在代码编写、终端操作和工具调用链条中的准确度与稳定性均达到可用级别,能满足日常开发需求。
性价比碾压:同等编程任务,V4-Flash成本仅为海外旗舰模型的数十分之一至百分之一,输入价格1元/百万Token,输出2元/百万Token。
局限性认知:作为纯文本模型,V4-Flash不支持多模态输入;在复杂物理仿真、硬件适配等需深度推理的场景,仍需要人类工程师校准。