洗碗机在转
2026-08-13 09:11来自 科技看点

DeepSeek V4 Pro正式版大模型藏了什么大招?Agent能力暴涨近5倍,3元/百万token值不值得升级?

  8月12日深夜,DeepSeek将V4 Pro预览版升级为正式版(版本号0813),Agent核心基准DeepSWE从12.8%飙升至62.7%,暴涨近5倍;多项智能体测试逼近甚至反超Anthropic旗舰模型Claude Fable 5,而API输入价格仅3元/百万token,输出6元,成本约为Fable 5的几十分之一。这就是DeepSeek最新版本藏的大招。

  这次更新没有预热,也没有官方公告。北京时间8月12日深夜,DeepSeek官网API文档悄然将deepseek-v4-pro对应的模型版本更新为DeepSeek-V4-Pro-0813,开发者已可通过API调用。据新浪科技等多家媒体报道,新模型在多项智能体测试中的表现已经逼近甚至反超Anthropic前沿模型Claude Fable 5,整体表现相比V4 Pro预览版明显提升。巧合的是,此次发布几乎与SpaceXAI发布Grok 4.6同步,两款主打高性价比的模型同时冲击前沿模型第一梯队。

  DeepSeek V4 Pro正式版相比预览版,到底升级了什么?

  核心答案是:Agent能力迎来质的飞跃。最硬核的指标是DeepSWE(代码修复基准),从预览版的12.8%飙升至62.7%,涨幅接近5倍[1]。这并不是挤牙膏式的微调,而是代际式跨越。

  根据公开的对比数据,V4 Pro正式版在Terminal Bench 2.1上拿到87.9分,仅比Claude Fable 5低0.1分;在CyberGym安全智能体评测中以83.3分反超Fable 5;在AutomationBench等多项智能体测试中也超过了Opus 4.8[2]。相比7月31日发布的V4 Flash正式版,Pro-0813几乎沿着整条Agent能力线又涨了一轮:

  • Terminal Bench:82.7 → 87.9
  • NL2Repo:54.2 → 61.5
  • CyberGym:76.7 → 83.3
  • DeepSWE:54.4 → 62.7
  • AutomationBench:25.1 → 31.8
  • HLE(带工具):51.5 → 60.0

  这些数字意味着什么?DeepSWE、Terminal Bench、AutomationBench都是衡量大模型在真实计算机环境中自主完成编码、终端操作和多步任务的能力。过去这类任务是闭源前沿模型的专属领域,而DeepSeek V4 Pro正式版以不到3元的输入价格,把Agent能力拉到了第一梯队。

  DeepSeek V4 Pro正式版性能到底有多强,能超过Claude Fable 5吗?

  结论先行:在多项智能体测试中,V4 Pro正式版已经追平甚至反超Claude Fable 5,但在综合性能上仍需更多第三方评测验证。从官方给出的数字看,V4 Pro正式版Terminal Bench 2.1得分87.9,仅比Fable 5的88.0低0.1;在CyberGym上则反超(83.3 vs 82.9)。在DeepSWE和AutomationBench上,它也明确超过了Anthropic的Opus 4.8。

  不过要注意,这些成绩来自DeepSeek官方公布的评测表,尚未经过独立第三方广泛验证。有开发者指出,厂商通常只会选择有利于自己的benchmark,真正要看的是在真实业务中的效果。但即便打点折扣,这样的成绩也足以让闭源巨头感到压力。

“大模型没有性能护城河,价格战不可避免。”——部分AI从业者认为,DeepSeek的低价高性能将迫使同行重新定价。

  DeepSeek V4 Pro正式版价格和配置如何?API怎么收费?

  结论:价格维持在此前预览版水平,但官方已预告大幅涨价,现阶段是“加量不加价”的窗口期。DeepSeek V4 Pro正式版支持100万token上下文,最大输出38.4万token,并支持思考/非思考模式、Tool Calls、Responses API、Anthropic API兼容以及FIM补全[3]

  价格方面,API定价为:缓存未命中输入3元/百万token,输出6元/百万token;缓存命中输入0.025元/百万token[3]。这是V4 Flash版本的三倍。同时,Pro版本的并发上限压缩至500,而Flash为2500,明确聚焦高价值复杂任务,而非通用轻量调用。

  值得注意的是,DeepSeek官方已经预告API服务近期将整体涨价,且“预计涨幅较大”[4]。但截至8月13日,正式版发布时尚未调价。对于有需求的企业开发者,当前可能是以低价锁定高性能的最后机会。

  DeepSeek V4 Pro正式版和V4 Flash怎么选?适合哪些人?

  结论:如果任务涉及复杂代码审查、长文档分析、多步Agent流程,选Pro;如果只是高频、轻量的通用调用,Flash性价比更高。

产品/型号价格/定位核心配置优势短板适合谁注意点
DeepSeek V4 Pro-08133元/百万token输入,6元/百万token输出,高性能专业版1M上下文,384K最大输出,Agent能力暴涨,并发上限500性价比极高,Agent能力强,支持Anthropic API兼容并发限制500,官方预告涨价企业级Agent、深度代码任务、长文档处理涨价前尽快测试,价格以官方实时为准
DeepSeek V4 Flash-0731约为Pro的1/3,主打高性价比1M上下文,并发上限2500便宜,高并发,适合大规模调用Agent能力弱于Pro通用问答、摘要、语义检索等高频场景复杂任务可能“力不从心”
Claude Fable 5据公开报道,成本是DeepSeek的几十倍闭源旗舰,性能顶尖综合能力最强,生态成熟价格昂贵不差钱且追求极致效果的企业成本高,需评估ROI
Grok 4.6据公开报道,约为DeepSeek的5倍开源/低成本,与DeepSeek同日发布技术开放,品牌知名度高在多项Agent基准上被DeepSeek追平或反超愿意尝试开源模型的开发者第三方评测尚待公布

  具体来看,Pro的100万token上下文可以一次吞下整本《三体》体量的长文本,配合38.4万token输出,适合处理完整代码库、生成大规模文档。但并发限制500意味着它不适合超大规模并发调用。Flash虽然Agent能力弱一些,但并发上限2500,价格只有Pro的1/3,更适合聊天机器人基础问答、内容摘要等场景。

  从商业定位看,DeepSeek正在复制OpenAI的区分策略:Flash走量,Pro走深度。官方甚至为Pro提供了Anthropic API兼容接口,吸引原本使用Claude的开发者直接迁移。

  DeepSeek V4 Pro正式版上线,对AI行业意味着什么?

  结论:大模型价格战进入新阶段,分层商业化成定局,国产算力适配成为里程碑。DeepSeek V4全系原生适配华为昇腾,重写数百个核心算子,摆脱对CUDA生态依赖,并非简单概念兼容,而是已经实现规模化商用落地[5]

  这背后是AI产业的明牌:从拼参数、拼低价,转向拼算力壁垒、拼商业化变现。长上下文推理是算力消耗大户,百万token上下文对显存、带宽、集群互联的要求更高,算力硬件刚需持续放大。映射到产业链,AI服务器、高速光模块、DRAM/HBM等环节值得关注。

  舆论场对比明显:有人认为“大模型没有性能护城河,价格战不可避免”,也有人对官方评测持观望态度。但一个事实是,DeepSeek目前已是全球大模型Token使用量第二,仅次于Anthropic,V4 Pro正式版发布后甚至可能冲击第一[6]。全球token均价两个月跌了50%,低成本token正在统治使用量。

  QA常见问题解答

  Q1:DeepSeek V4 Pro正式版价格多少?会涨价吗?

  目前DeepSeek V4 Pro正式版API定价为:输入3元/百万token(缓存未命中),输出6元/百万token,是V4 Flash的三倍。官方已预告近期将大幅涨价,但截至8月13日尚未调整,最终以官方实时信息为准[4]

  Q2:DeepSeek V4 Pro正式版相比预览版强了多少?

  Agent能力大幅提升,DeepSWE从预览版的12.8%升至62.7%,涨幅近5倍;Terminal Bench 2.1达到87.9,逼近Claude Fable 5的88.0,CyberGym甚至反超。此外,新版支持100万token上下文和38.4万token输出,价格不变[1][2]

  Q3:DeepSeek V4 Pro正式版和V4 Flash怎么选?

  Pro定位高性能复杂任务,如代码审查、多步Agent流程,并发上限500,价格是Flash三倍;Flash定位高并发、高性价比,并发上限2500。日常轻量调用选Flash,深度任务选Pro[3]

  #DeepSeekV4Pro# #DeepSeek最新版本# #DeepSeek大招# #AI大模型价格战# #Agent能力暴涨#