
新浪极客前线
deepseek flash正式版在Agent任务中实际表现如何?
DeepSeek V4 Flash正式版于7月31日开启API公测,在模型架构不变的情况下,其Agent能力凭借后训练优化大幅跃升,多项基准测试反超自家的V4 Pro预览版,引发了开发者社区的广泛关注。
一、Agent基准跑分全面反超Pro预览版
终端操作:Terminal Bench 2.1得分82.7,远超V4-Pro-Preview的72.1,逼近Opus-4.8的85.0
软件工程:DeepSWE从预览版的7.3飙升至54.4,暴涨超6倍;DSBench-FullStack全栈开发达68.7
工具调用:Toolathlon-Verified得分70.3,接近Opus-4.8的76.2;Cybergym网络安全测试达76.7
智能指数:Artificial Analysis智能指数(AII)获得50分,仅比GPT-5.6 Luna低1分
二、技术路径:不改架构,纯靠后训练
模型不变:V4-Flash-0731总参数2840亿、激活参数130亿的MoE架构与Preview版完全一致
优化手段:仅重新进行后训练(Post-Training)优化,未改动底层架构
意义:证明后训练阶段的优化空间可能比单纯堆参数更具杠杆效应,为轻量模型释放旗舰级Agent能力提供了新路径
三、开发者友好:低价+原生适配主流工具链
价格优势:API定价未涨,输出仅2元/百万tokens(非高峰),缓存命中时低至0.02元/百万tokens
兼容性:原生支持OpenAI Responses API格式,并针对Codex完成适配,提供一键配置脚本
迁移成本:现有项目无需改动底层部署,直接切换模型版本即可获得Agent能力提升

