财经盘面记
20小时前来自 科技看点

DeepSeek-V4-Flash正式版上线!Agent能力反超Pro

DeepSeek-V4-Flash正式版API于7月31日上线公测,在不改动模型架构的前提下,仅通过后训练优化就让Agent能力全面反超自家旗舰Pro预览版,同时保持了极低的调用成本,成为AI圈最受关注的“性价比之王”。

一、发布核心:架构不变,能力倍增

上线时间与版本:7月31日,DeepSeek通过API文档宣布DeepSeek-V4-Flash正式版(模型版本0731)上线公测。模型结构与预览版完全一致(总参数2840亿、激活参数130亿)。

升级路径:仅重新进行了后训练(Post-Training)优化,预训练底座和模型尺寸均未改变。

接口支持:原生支持Responses API格式,并针对性适配了Codex开发工具,降低了开发者接入门槛。

使用限制:此次更新仅面向API接口,App和网页端暂未升级,V4-Pro正式版将尽快发布。

二、跑分表现:全面超越Pro预览版

综合智能指数:在Artificial Analysis的AII测试中获得50分,较4月旧版提升10分,比V4 Pro预览版高6分,仅落后GPT-5.6 Luna 1分。

Agent能力测试:在官方公布的9项Agent基准测试中,成绩全部超越V4 Pro预览版。其中Terminal Bench 2.1得分为82.7,逼近Claude Opus 4.8的85分;DeepSWE编码测试从预览版的7.3分暴涨至54.4分,飙升超过6倍。

前端代码专项:在前端代码竞技场(Frontend Code Arena)中以1586分刷新榜单,开放类别排名第3。

三、定价优势与实测反馈

极致低成本:API定价为输入1元/百万tokens、输出2元/百万tokens,缓存命中低至0.02元/百万tokens。得益于约98%的缓存命中折扣,单任务成本比降价后的GPT-5.6 Luna仍低约60%。

开发者实测:AI开发者张泽将V4-Flash接入Hermes测试,相同任务耗时40秒(GPT-5.6 Sol+Codex用时1分47秒),51万tokens消耗仅0.53元。多位开发者反馈其任务处理速度显著领先竞品,Agent工具调用准确度令人满意。

长文本与使用体验:支持100万token超长上下文,可一次容纳70多万字内容。在处理长文档、代码开发、推理分析等任务时表现稳健,尤其是在性价比上形成碾压优势。