硬件演进簿
8-1 15:56来自 科技看点

DeepSeek-V4-Flash实测:价格碾压GPT-5.6

DeepSeek-V4-Flash正式版的跑分结果出炉了:模型没动底层架构,纯靠后训练优化,多项测试得分不仅全面超越自家Pro预览版,还死死咬住了GPT-5.6 Luna,但价格却便宜了一大截。

这次升级的核心逻辑,可以用一句话概括:不换脑子,只换训练方法,把同一个模型的Agent能力翻倍式拉高。实测结果从以下几个维度清晰可见。

一、核心跑分:Agent与代码能力暴涨

综合智能指数飙升:在海外权威评测机构Artificial Analysis的AII智能指数测试中,V4-Flash-0731版本拿下50分,比4月版本高出10分,仅比GPT-5.6 Luna低1分。

Agent能力全面反超:在九项官方Agent基准测试中,正式版全部反超自家的V4-Pro预览版。其中Terminal Bench 2.1得分82.7,超越智谱GLM-5.2的81.0分,逼近Anthropic Opus-4.8的85.0分;DeepSWE(软件工程能力)从预览版的7.3分暴涨至54.4分,涨幅超过7倍;Toolathlon-Verified工具调用达到70.3分。

前端代码竞技场刷新记录:在Frontend Code Arena(前端代码竞技场)中,V4-Flash-High档位以1586分位列总榜第7、开放类别第3,较预览版提升154分。

二、技术路径:零架构改动,纯后训练提升

架构与参数不变:模型保持2840亿总参数、130亿激活参数的MoE架构,网络结构和尺寸与预览版完全一致。

后训练优化是唯一变量:所有性能提升都来自重新进行的后训练——重点强化了任务拆解、工具调用、代码执行和错误恢复等智能体行为能力。

原生支持关键接口:首次原生适配OpenAI Responses API格式,并针对Codex场景完成深度适配,开发者可以无缝将模型接入Codex CLI、VSCode插件等开发工具链。

三、极致性价比:白菜价打出旗舰表现

API定价极低:输入1元、输出2元每百万Token,缓存命中时更低至0.02元/百万Token。

成本碾压海外竞品:凭借约98%的缓存命中折扣,其单任务成本比降价80%后的GPT-5.6 Luna仍低约60%。

同级对比优势明显:从实际调用成本看,V4-Flash的性价比在全球模型中处于前沿点位——用极低的价格实现了与海外高端模型接近的代码和推理能力。