V4 Pro在哪些测试中超越了Fable 5?
一、核心亮点:三项测试直接反超Fable 5
V4 Pro正式版(版本号DeepSeek-V4-Pro-0813)在多项智能体基准测试中表现亮眼,其中两项测试得分直接超越Fable 5:
CyberGym(网络安全智能体):得分83.3分,超过Fable 5的83.1分和Opus 4.8的78.3分。
AutomationBench(自动化任务):得分31.8分,压过Fable 5的29.1分和Opus 4.8的27.2分。
这两项测试聚焦AI在真实场景中的"动手干活"能力,包括工具调用、多步骤任务执行和代码修改等,是衡量大模型实用性的关键指标。
二、逼近与反超:多项智能体测试追平第一梯队
除超越项目外,V4 Pro在更多测试中已逼近Fable 5,大幅超越此前预览版:
Terminal Bench 2.1(终端Agent测试):得分87.9分,仅差Fable 5的88.0分0.1分,超过Opus 4.8的85.0分。
DeepSWE(软件工程智能体):从预览版的12.8分暴涨至62.7分,翻了近5倍,超过Opus 4.8的58.0分,距离Fable 5的70.0分仅剩7.3分。
带工具的人类最后考试:得分60.0分,反超Opus 4.8的57.9分,继续逼近Fable 5的63.0分。
这些数据表明,V4 Pro正式版在Agent方向的积累已转化为显著的实际任务执行能力。
三、关键参数与定价:能力升级但价格维持不变
V4 Pro正式版在升级能力的同时维持了极具竞争力的价格策略:
- 维度
- 具体内容
- 上下文窗口100万Token上下文,最高38.4万Token输出
- 功能支持思考/非思考双模式、Tool Calls、Responses API、Anthropic API
- 定价(每百万Token)输出6元;输入缓存命中0.025元、缓存未命中3元(为Flash版3倍)
- 价格预告官网已预告近期将整体上调API定价,"预计涨幅较大"
V4 Pro的性能已接近全球最强模型,价格却仅为海外竞品的几十分之一——Grok 4.6为6美元/百万输出Token,而Anthropic Fable 5则高达50美元/百万输出Token。
