科技看点集
17小时前来自 科技看点

DeepSeek-V4-Flash正式版的性能相比预览版有哪些提升?

一、Agent 能力飞跃:多项基准测试全面碾压预览版

正式版 V4-Flash 最核心的升级在于 Agent 能力的大幅增强,在多项基准测试中表现显著提升 。- 软件工程任务飙升:DeepSWE 从预览版的 7.3 分飙升至 54.4 分,Cybergym 从 38.7 提升至 76.7,AutomationBench 从 10.8 涨到 25.1 。- 终端与工具操作接近顶级:Terminal Bench 2.1 达到 82.7 分,逼近 Claude Opus 4.8 的 85.0 分;Toolathlon Verified 得分为 70.3,工具调用稳定性显著优于预览版 。- 全栈开发能力强化:内部全栈测试 DSBench-FullStack 达到 68.7,高难度编码专项 DSBench-Hard 取得 59.6 分,整体 Agent 能力已超过 GLM-5.2,在开源模型中表现突出 。

二、开发者生态升级:原生支持 Responses API 并适配 Codex

正式版在开发者工具链兼容性上做了重大改进,大幅降低了集成门槛 。- 原生支持 Responses API:完美兼容 OpenAI 的新一代接口标准,便于开发者直接调用工具执行、多轮任务和 Agent 工作流 。- 一键接入 Codex 生态:已针对性适配 Codex,提供了一键配置脚本,可在 Codex CLI、ChatGPT 桌面端和 VSCode 插件中直接调用,程序员无需额外开发即可复用现有工作流 。- 零迁移成本:模型结构和尺寸与预览版完全一致,现有项目无需改动底层部署,仅切换模型版本即可体验提升 。

三、极致性价比:定价不变,智能翻倍

V4-Flash 正式版在保持原有价格体系的同时,实现了性能的跃升,单位成本能买到的“智能”大幅增加 。- 价格对比优势明显:输入 1 元/百万 token,输出 2 元/百万 token,比降价 80% 后的 GPT-5.6 Luna 还要便宜约 60% 。- 智能等级显著提升:在 Artificial Analysis Intelligence Index 中综合得分达 50 分,比前代高出 10 分,与 Gemini 3.6 Flash 持平,综合得分仅比 GPT-5.6 Luna 低 1 分 。- 低成本批量部署:对于每日需要处理海量请求的自动化 Agent 场景,调用成本仅为顶级模型的几分之一甚至十分之一,使得大规模智能体落地成为可能 。