新浪极客前线
18小时前来自 科技看点

deepseek flash正式版的后训练优化具体做了什么?

DeepSeek-V4-Flash正式版7月31日上线,这次升级最特别的地方在于模型架构和参数量完全没动,纯靠重新做后训练优化就让智能体(Agent)能力暴涨,多项跑分反超自家V4-Pro预览版,甚至逼近GPT-5.6 Luna的水平。

一、后训练优化的核心做法

不动底座,专注行为对齐:V4-Flash-0731保持284B总参/13B激活的MoE架构不变,未改动模型结构和尺寸,仅针对Agent执行场景重新完成后训练优化。官方明确表示,能力跃升全部来自后训练而非堆砌参数。

专项强化智能体行为:后训练重点优化了模型的任务拆解、工具调用、代码执行与终端操作能力,让模型从“回答一个问题”变成“完成一个任务”,能够自主规划、调用工具、排查错误。

强化学习与对齐调优:采用两阶段后训练流程,针对预览版完成一轮强化学习微调,在长文本检索、工具调用稳定性上明显提升,使轻量模型在工程化场景打出旗舰水平。

二、Agent能力跃升的具体表现

九项基准全面反超Pro预览版:在官方公布的9项Agent测试中,V4-Flash正式版全部超越此前V4-Pro-Preview版。

关键跑分数据亮眼:Terminal Bench 2.1达82.7分,超越GLM 5.2的81.0分;DeepSWE软件工程修复从预览版7.3分飙升至54.4分,暴涨超7倍;DSBench-FullStack全栈开发得分68.7。

前端代码能力跻身一线:在Frontend Code Arena(前端代码竞技场)获得1586分,总排名第7、开放类别第3,较预览版提升154分。

三、后训练优化的技术意义与生态配套

证明后训练是高效杠杆:在参数规模不变、推理成本不变的前提下,仅靠后训练让Agent能力实现翻倍式增长,说明“精调优”的后训练阶段还有巨大挖掘空间。

原生支持Responses API:正式版原生兼容Responses API格式,并针对Codex进行深度适配,开发者迁移接入成本极低。

定价维持极致性价比:API定价输入1元/输出2元每百万Token,配合约98%的缓存命中折扣,单任务成本比降价后的GPT-5.6 Luna仍低约60%。