
DeepSeek V4 Flash的Agent能力为何提升这么大?
一、后训练优化:没换脑子,但换了训练方法
只练不换:V4-Flash正式版模型结构与预览版保持不变,依旧是2840亿参数、130亿激活参数的MoE架构,但通过重新进行深度后训练,Agent性能实现质的飞跃。
Agent基准测试全线反超:在官方公布的9项Agent测试中,正式版全面碾压了三个月前的V4-Pro预览版。其中Terminal Bench 2.1得分从61.8飙升至82.7,逼近Claude Opus 4.8的85.0分;DeepSWE从7.3分暴涨至54.4分,增幅超6倍;DSBench-FullStack从37.0分涨至68.7分。
智能指数飞跃:在第三方独立机构Artificial Analysis的智能指数测试中,V4-Flash-0731获得50分,比4月发布的预览版高出10分,甚至反超了自家V4-Pro预览版6分,仅比GPT-5.6 Luna的51分低1分。

二、技术原理:后训练的杠杆效应被低估了
从“堆参数”转向“训数据”:这次升级打破了行业“Pro强、Flash弱”的传统分层认知。正如DeepSeek官方所言,“模型结构、尺寸和预览版保持一致,仅重新进行了后训练”。这证明对于特定Agent任务,模型规模并非决定性因素——训练方法和数据质量的权重正在上升。
为何后训练效果如此显著:Agent任务(如终端操作、工具调用、代码修复)本质上是多步推理与决策的复合能力,而非单纯的语言生成。后训练阶段可以针对这些场景输入大量高质量的多步轨迹数据,让模型学会“何时调用工具、如何根据反馈调整步骤、怎样处理异常状态”,相当于给模型的大脑装了一套专门的“执行操作系统”。
原生支持Codex与Responses API:正式版原生支持Responses API格式,并专门针对Codex进行了适配,使得开发者无需大规模改造现有项目,切换模型版本即可获得更好的Agent任务执行效果。
三、极致性价比:用Opus零头成本,咬住Agent第二梯队
价格屠夫:V4-Flash正式版的API定价为输入1元、输出2元每百万Token,缓存命中时更是低至0.02元每百万Token。配合约98%的缓存命中折扣,单任务成本比降价80%后的GPT-5.6 Luna仍低约60%。
成本效率对比:在WorkBuddy等开发者工具中,V4-Flash每次调用仅消耗0.06积分,而同等能力模型往往需要数倍甚至数十倍的成本。一位开发者实测,执行一次51万Tokens的本地文件阅读与全网信息检索任务,仅消耗0.53元。
定位精准:综合Agent能力被行业定位在GLM 5.2(1510 Elo)与Kimi K3(1687 Elo)之间,属于“性价比特化”选择。对于日常高频的批量任务处理、代码自动化和Agent工作流,V4-Flash已成为目前市面上成本最低的“可行选择”。