硬件演进簿
16小时前来自 科技看点

DeepSeek-V4-Flash为何不换架构只靠后训练提升?

DeepSeek V4 Flash正式版跑分日前出炉,一个最反直觉的发现是:模型架构和参数规模都没变,纯靠重新做后训练(Post-Training),就把Agent智能体能力拉到了逼近GPT-5.6 Luna的水平。

一、后训练的本质:不动底座,只改“行为方式”

架构零改动:V4-Flash正式版延续了2840亿总参数/130亿激活参数的MoE架构,模型结构与尺寸和4月发布的预览版完全一致。

后训练做了什么:大模型训练分预训练(学知识)和后训练(学做事)。V4-Flash重新进行后训练优化,重点强化了工具调用、任务拆解、代码执行等Agent行为能力,相当于“同一个人换了工作方法”。

核心验证:官方强调所有能力提升“仅来自重新进行的后训练优化”,未堆砌参数规模,这打破了行业“性能提升必须堆参数”的固有认知。

二、跑分暴涨:九个Agent基准全面反超Pro预览版

工程编码能力飙升:代表真实软件工程能力的DeepSWE从预览版的7.3分暴涨至54.4分,涨幅超过7倍;Terminal Bench 2.1达到82.7分,超越GLM 5.2的81分,逼近Claude Opus 4.8的85分。

全栈与工具调用突破:DSBench-FullStack全栈开发得分68.7分,Toolathlon工具调用得分70.3分,Cybergym网络安全测试76.7分,9项官方Agent测试全面超越V4-Pro预览版。

前端代码竞技场:在Frontend Code Arena中以1586分位列开放类别第3,较预览版提升154分。

第三方验证:在Artificial Analysis智能指数中获50分,仅比GPT-5.6 Luna低1分,比同类模型中位数(17分)高出近3倍。

三、高性价比路线:不卷参数卷软实力

价格优势明显:API定价维持输入1元/输出2元每百万Token,依托约98%的缓存命中折扣,单任务成本比降价80%后的GPT-5.6 Luna仍低约60%。

开发者友好:原生支持Responses API并针对性适配Codex,开发者无需更换接口即可调用,迁移成本几乎为零。

行业意义:这次升级证明大模型竞争逻辑正在转变——从“堆参数量、卷算力”转向“靠精细化后训练对齐+极致工程化”,对开发者意味着可以用更低成本搭建高性能AI智能体。