
deepseek flash正式版跑分直逼GPT-5.6,价格仅零头
DeepSeek-V4-Flash正式版跑分出炉,在完全不改动底层模型架构的前提下,仅凭后训练优化就让Agent能力实现越级,多项跑分直逼GPT-5.6等顶级闭源模型,但价格却只有对手的一个零头。
一、核心跑分成绩单:逼近顶级闭源模型
综合智能指数:在Artificial Analysis的AII测评中,V4-Flash-0731拿到50分,比4月版本高出10分,仅落后GPT-5.6 Luna(51分)1分,比自家的V4-Pro预览版还高6分。
前端代码能力:在Arena Frontend Code Arena榜单中,DeepSeek-V4-Flash-High以1586分刷新记录,总排名第7、开放类第3,较预览版性能提升154分。
Agent专项测试:Terminal Bench 2.1达82.7分,超越智谱GLM 5.2;DeepSWE编程测试从预览版7.3飙升至54.4分;全栈开发DSBench-FullStack达68.7分,高难度DSBench-Hard达59.6分。
二、技术路径:不换脑子只换练法
零架构改动:模型保持2840亿总参数、130亿激活参数的MoE架构,与预览版完全一致,纯粹靠重新做后训练实现能力跃升,打破了“旗舰必须强于轻量版”的固有认知。
Agent能力全面反超旗舰:官方公布的9项Agent基准测试中,Flash正式版全部碾压V4-Pro预览版,在终端操作、工具调用、代码调试等场景进步最为显著。
行业竞争逻辑正在改变:大模型竞争不再单纯拼参数量和预训练算力,精细化后训练、对齐优化成为新的决胜手,参数规模的决定性权重正在被稀释。
三、定价与生态:极致性价比撬动开发者
成本碾压同级:API定价维持输入1元/输出2元每百万Token,配合约98%的缓存命中折扣,单任务成本比降价后的GPT-5.6 Luna仍低约60%,成为同级模型中性价比最高的选择。
原生接入开发者生态:正式版原生支持Responses API格式,并针对Codex完成专项适配,官方还提供了一键配置脚本,开发者可从OpenAI生态零成本切换。
开箱即用激活社区:MIT协议完全开放商用,可本地部署与二次开发,已有实测显示其单任务Agent成本低至3美分,将Agent应用的门槛从“一杯咖啡”降到“一颗糖”。