数码新声
8-1 15:34来自 科技看点

DeepSeekV4Flash正式版跑分出炉:仅差GPT-5.6一分

7月31日,DeepSeek-V4-Flash正式版API开启公测,8月1日各大跑分平台同步放榜——架构没变、参数没涨,仅靠后训练优化就将综合智能指数拉到仅差GPT-5.6 Luna 1分,而单任务成本却比对手低约60%,这匹“轻量化黑马”正在改写大模型的性价比规则。

一、跑分全面逼近旗舰:智能指数50分,终端操作超GLM5.2

综合智能指数:在Artificial Analysis的AII测试中,V4-Flash-0731拿下50分,较4月发布的旧版提升10分,比自家V4 Pro高6分,仅比GPT-5.6 Luna(51分)低1分。

终端操作:Terminal Bench 2.1得分82.7,超越智谱GLM-5.2的81.0分,逼近Opus 4.8的85.0分。

代码能力:DeepSWE(软件工程基准)从预览版7.3暴涨至54.4,提升超6倍;前端代码竞技场(Frontend Code Arena)以1586分刷新榜单,开放类别排名第3。

二、极致性价比:成本仅为竞品1/10,98%缓存折扣是关键

定价水平:API输入1元/百万Token,输出2元/百万Token,缓存命中时低至0.02元。

成本对比:即使OpenAI将GPT-5.6 Luna降价80%,V4-Flash的单任务成本仍低约60%。这得益于DeepSeek提供约98%的缓存命中折扣,远超行业常见的90%。

架构优势:总参数2840亿但激活仅130亿的MoE架构,配合FP4/FP8低精度推理,实现高吞吐、低延迟。

三、后训练驱动的智能体跃升:架构不变,能力翻倍

优化思路:模型结构与Preview版完全一致,仅通过重新进行后训练(Post-Training)优化,在Agent能力上实现越级提升。

Agent专项:9项Agent基准测试全部超越V4-Pro预览版,包括Cybergym 76.7分、Toolathlon 70.3分、DSBench-FullStack 68.7分等。

生态适配:原生支持Responses API,并针对Codex完成适配,开发者无需更换接口即可接入。公测仅限API,App和网页端暂未更新,V4-Pro正式版预计8月初发布。