新智元
26-08-13 07:16 微博认证:新智元官方微博

##DeepSeek发布V4Pro正式版## 梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了

今天,这一架太魔幻了!

一边是梁文锋,终于在凌晨放出了DeepSeek V4 Pro正式版。

另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。

两大巨头,同一时间发布,火药味儿瞬间拉满。

他们盯上的,几乎是同一件事——

让模型能在长任务里持续调用工具、修改代码、验证结果,最后交付一个真正能用的成品。

DeepSeek V4 Pro正式版最亮眼的成绩,是在两项评测中拿下绝对第一,直接反杀Fable 5。

网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1分、Opus 4.8的78.3分。
自动化任务AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起压了下去。

最「贴脸」的一次,则发生在Terminal-Bench 2.1。

DeepSeek拿到87.9分,超过Opus 4.8的85.0分,距离Fable 5的88.0分,只差0.1。

其他几项高难度Agent测试中,DeepSeek则实现了对Opus 4.8的绝对跨越。

带工具的「人类最后考试」中拿到60.0分,反超Opus 4.8的57.9分,继续逼近Fable 5的63.0分。

就连此前最薄弱的软件工程智能体,DeepSWE也从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。

这个成绩不仅超过Opus 4.8的58.0分,距离Fable 5的70.0分也只剩7.3分。

同一时间,马斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。

Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。

综合智能指数上拿到61分,距离Fable 5的62分只差1分。
CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。
FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。

到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。

GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。
AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。
专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

更狠的是,DeepSeek V4 Pro和Grok 4.6不仅在性能上直逼OpenAI和Anthropic的顶尖模型,还一起把前沿智能的价格打了下来。

每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。

而DeepSeek只要0.87美元——

约为Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!