渡势行
26-08-02 12:37 微博认证:投资内容创作者

【DeepSeek-V4-Flash正式版API上线公测:Agent能力直逼Opus-4.8,价格却是"地板级"】

7月31日,DeepSeek在API文档更新日志中悄然放出V4-Flash正式版(版本号DeepSeek-V4-Flash-0731),同步开启公测。没有发布会、没有通稿,但AI开发者圈瞬间炸锅——因为这次升级的不是一个"更快的模型",而是把Agent(智能体)能力直接拉到了顶级梯队。

🎯 核心升级:Agent跑分逼近Opus-4.8

在Agent智能体终极测试(Agents' Last Exam)中,V4-Flash正式版拿下25.2分,远超V4-Pro预览版的15.8分,距离Opus-4.8的25.7分仅一步之遥。

更完整的基准测试矩阵里,V4-Flash正式版的表现全面碾压V4-Pro预览版:

测试集 V4-Flash正式版 V4-Pro预览版 GLM-5.2 Opus-4.8
Terminal Bench 2.1 82.7 61.8 81.0 85.0
NL2Repo 54.2 39.4 48.9 69.7
Toolathlon-Verified 70.3 49.7 59.9 76.2
Agents' Last Exam 25.2 15.8 23.8 25.7
AutomationBench 25.1 10.8 12.9 27.2

💡 注意一个关键信号:在Agent类任务上,Flash正式版已经反超了Pro预览版。这意味着DeepSeek的策略很清晰——Flash走"Agen特化+极致性价比"路线,Pro后续才补齐通用能力天花板。

⚡ 开发者实测:40秒 vs 1分47秒

AI深度开发者张泽第一时间把V4-Flash正式版接入Hermes使用,给出两组非常直观的对比:

🕐 速度维度

相同任务和提示词下:

• V4-Flash + Hermes:约40秒完成

• GPT-5.6 Sol + Codex:1分47秒完成

Codex输出质量确实更高,但V4-Flash的交付"达到可用水平,在及格线之上"。

💰 成本维度

张泽用V4-Flash接入Hermes执行了一次"本地文件阅读+全网信息检索汇总"任务:

• Token消耗量:51万

• 实际花费:0.53元

对比海外旗舰模型,按官方API定价:

• GPT-5.6 Sol:输入5美元/百万tokens、缓存输入0.5美元、输出30美元

• V4-Flash:输入1元、缓存输入0.02元、输出2元(人民币)

成本差距在数十倍到上百倍。

📋 官方规格与定价(当前生效版)

根据DeepSeek API官方文档,V4-Flash正式版关键参数:

🔧 模型规格

• 上下文长度:1M tokens

• 最大输出:384K tokens

• 并发限制:2500

• 支持:Tool Calls、Json Output、Responses API、Anthropic API格式

💵 百万tokens定价

• 输入(缓存命中):0.02元

• 输入(缓存未命中):1元

• 输出:2元

⚠️ 关于"峰谷定价":DeepSeek邮件中预告高峰时段价格可能翻倍(输入2元/输出4元),但具体执行时间尚未正式通知,当前仍按上述基础价格计费。

🔮 更大的棋:DeepSeek Harness即将公布

这次发布最值得关注的"彩蛋",是DeepSeek首次披露DeepSeek Harness即将公布。

Harness是包裹在AI模型外的整套工作条件——负责给模型准备上下文、工具、任务状态、反馈和边界,简单说就是让AI从"能聊天"变成"能干活"的基础设施。

中信证券对此的判断很直接:

1. 解决长程任务痛点,将模型能力转化为稳定、低成本的端到端交付

2. 连接模型与泛办公场景,拓展万亿市场并沉淀稀缺数据反哺迭代

3. AI竞争正由"模型"转向"任务交付",成熟Harness厂商将占先机

值得注意的是,6月21日崔添翼就在社交媒体发文:作为新成立的部门,DeepSeek Harness组"目标远大、工作繁重,仍然非常缺人"。这次V4-Flash的Agent能力跃升,很可能就是Harness团队的第一份答卷。

🌏 中国模型全球份额已超美国

OpenRouter数据显示,中国AI大模型周调用量领跑全球,前五名中DeepSeek独占两席(V4-Flash、V4-Pro)。截至7月26日的近28天统计:

• 中国模型全球市场份额:约63.5%

• 美国模型份额:35.5%

V4-Flash正式版的发布,无疑会进一步巩固中国模型在开发者市场的性价比护城河。

------

📌 给开发者的判断:如果你做的是Agent、代码生成、长文档处理、批量自动化任务,V4-Flash正式版在当前这个价位(0.02元缓存输入/1元输入/2元输出)几乎是"无脑接入"级别的选择。它不追求在综合智能上超过Opus-4.8,但在Agent交付这个垂直场景里,已经把"够用"和"便宜"做到了极致。

至于V4-Pro正式版,官方口径是"尽快",外界预计8月初。那时候才是DeepSeek真正亮旗舰肌肉的时刻。

#DeepSeek ##V4Flash正式版 ##AI Agent ##大模型定价 ##API开发 ##人工智能 ##开源模型 ##中国AI崛起#

发布于 江苏