新浪极客前线
8-1 15:04来自 科技看点

deepseek flash正式版在Agent任务中实际表现如何?

DeepSeek V4 Flash正式版于7月31日开启API公测,在模型架构不变的情况下,其Agent能力凭借后训练优化大幅跃升,多项基准测试反超自家的V4 Pro预览版,引发了开发者社区的广泛关注。

一、Agent基准跑分全面反超Pro预览版

终端操作:Terminal Bench 2.1得分82.7,远超V4-Pro-Preview的72.1,逼近Opus-4.8的85.0

软件工程:DeepSWE从预览版的7.3飙升至54.4,暴涨超6倍;DSBench-FullStack全栈开发达68.7

工具调用:Toolathlon-Verified得分70.3,接近Opus-4.8的76.2;Cybergym网络安全测试达76.7

智能指数:Artificial Analysis智能指数(AII)获得50分,仅比GPT-5.6 Luna低1分

二、技术路径:不改架构,纯靠后训练

模型不变:V4-Flash-0731总参数2840亿、激活参数130亿的MoE架构与Preview版完全一致

优化手段:仅重新进行后训练(Post-Training)优化,未改动底层架构

意义:证明后训练阶段的优化空间可能比单纯堆参数更具杠杆效应,为轻量模型释放旗舰级Agent能力提供了新路径

三、开发者友好:低价+原生适配主流工具链

价格优势:API定价未涨,输出仅2元/百万tokens(非高峰),缓存命中时低至0.02元/百万tokens

兼容性:原生支持OpenAI Responses API格式,并针对Codex完成适配,提供一键配置脚本

迁移成本:现有项目无需改动底层部署,直接切换模型版本即可获得Agent能力提升