新浪AI前沿速递
15小时前来自 科技看点

DeepSeek V4 Flash正式版比预览版强在哪?

经过多次跳票,DeepSeek终于在7月31日放出了V4-Flash正式版API公测,它最核心的变化就是在模型架构完全不变的情况下,通过后训练把Agent能力拉到了一个远超预览版的水平,甚至反超了自家的Pro预览版。

一、Agent能力跃升:从“会聊天”到“会干活”

正式版最大的升级点不在参数规模上,而在实际执行能力,官方明确表示这次是“重新进行后训练”,重点强化了AI智能体(Agent)在终端操作、代码仓库管理和工具调用等方面的表现。

分数碾压预览版:在Terminal Bench 2.1测试中,正式版拿到82.7分,远超V4-Pro预览版在2.0版本的67.9分;内部代码测试DSBench-FullStack得分68.7,DSBench-Hard得分59.6。

软件工程能力质变:在DeepSWE(软件工程评测)中,正式版得分从预览版的7.4%飙升至54.4%,这意味着模型可以更好地完成修复Bug、修改代码、运行测试等复杂任务。

具身化操作能力:它能打开终端、调用工具、修改代码并自我纠错,不再只是“回答一个问题”,而是“完成一个任务”。

二、代码与开发工具链深度整合

正式版在开发者生态对接上迈出了关键一步,原生支持OpenAI的Responses API格式,并专门针对Codex工具链做了适配优化。

无缝接入主流工具:开发者只需一次配置,就能在Codex CLI、ChatGPT桌面端、VSCode的Codex插件里直接调用V4-Flash,等于让它无缝嵌入OpenAI的代码工作流。

模型尺寸不变:总参数2840亿、激活参数130亿的MoE架构与预览版完全一致,意味着用同样的硬件和推理成本,就能获得更强的代码生成与Agent能力,属于“加量不加价”。

三、极致性价比与普惠定位

V4-Flash正式版延续了DeepSeek一贯的低价策略,在性能逼近头部闭源模型的同时,将推理成本压到了极低水平。

定价优势:非高峰时段每百万Token输入仅1元,输出2元;缓存命中时甚至低至0.02元。即便高峰时段翻倍,也比同性能的闭源模型便宜数倍。

超长上下文:原生支持100万Token上下文(约70多万字),配合低显存占用的混合注意力机制,企业可以一次性把整本专业文档或全栈代码库丢进去处理。

定位清晰:它不追求全面超越顶级旗舰,而是抓住“推理成本+私有化部署+长文本算力优化”三大赛道,成为企业客服、文档分析、日常开发等高频场景的性价比之选。