
新浪AI前沿速递
DeepSeek-V4-Flash正式版的代码自动化能力具体体现在哪些方面?
一、Agent能力在多项基准测试中全面跃升
终端自动化任务:Terminal Bench 2.1达到82.7分,逼近Opus-4.8的85.0分,超越GLM-5.2的81.0分
软件工程智能体:DeepSWE从预览版的7.3分飙升至54.4分,涨幅超过7倍
全栈开发与工具调用:DSBench-FullStack达68.7分,DSBench-Hard达59.6分,Toolathlon Verified工具调用测试达70.3分
代码仓库生成:NL2Repo自然语言生成完整代码仓库得分为54.2分
二、原生支持Responses API并深度适配Codex
Responses API原生兼容:正式版直接支持OpenAI的Responses API格式,开发者无需额外适配即可在Agent框架中调用
Codex专项适配:针对OpenAI的Codex编程助手(覆盖CLI、ChatGPT桌面端、VS Code扩展)完成深度优化,开发者可一键配置让Codex客户端自动切换到DeepSeek模型
低迁移成本:Base URL和模型名保持不变,已部署项目无需大规模改造即可切换版本

三、极致性价比实现开发工具平权
定价优势:缓存命中时输入仅0.02元/百万tokens,输出2元/百万tokens,是同类产品中性价比最高的选择
高缓存命中折扣:约98%的缓存命中折扣,单任务成本比降价80%后的GPT-5.6 Luna仍低约60%
加量不加价:模型尺寸和推理延迟与预览版持平,开发者用同样成本获得更强的Agent执行能力