马斯克旗下SpaceXAI发布Grok 4.6大模型:智能指数61分追平GPT-5.6,如何从第17名杀回全球前三?
当地时间8月12日,马斯克旗下SpaceXAI发布新一代大模型Grok 4.6,智能指数61分追平GPT-5.6 Sol Max,从今年5月的第17名杀回全球第三,API定价仅为竞品一半。仅用一个多月,马斯克就为Grok系列打了一场漂亮的AI翻身仗。[1]
Grok 4.6发布背后:谁、何时、在哪里、做了什么?
Grok 4.6是马斯克旗下人工智能公司SpaceXAI于当地时间2026年8月12日发布的最新旗舰模型,距离上一代Grok 4.5发布仅一个多月。[1]这一天格外热闹:DeepSeek、阿里千问也和SpaceXAI在同一天发布了新模型。多位测评博主与从业者在社交媒体上感叹“又是一个不眠夜”。[1]
SpaceXAI官方给出的产品定位非常明确:Grok 4.6重点提升“长时间运行的AI智能体、复杂编程任务以及交互式和视觉项目开发”能力,并同步调低API调用成本。[2]在Artificial Analysis的智能指数排名中,Grok 4.6以61分与GPT-5.6 Sol Max并列全球第三,仅次于Anthropic的Claude Opus 5(63分)和Claude Fable 5(62分)。[1][4]相比上一代Grok 4.5的56分,这一代实现了5分的跳跃式提升。[4]
一、Grok 4.6凭什么追平GPT-5.6?智能指数61分意味着什么?
结论先行:Grok 4.6在Artificial Analysis的智能指数中拿下61分,与OpenAI旗舰GPT-5.6 Sol Max持平,并在GDPVal-AA v2知识工作评测中取得1753 Elo、拔得头筹。这意味着Grok已正式回归全球大模型第一梯队。
智能指数矩阵:与前代和竞品差多少?
Artificial Analysis的智能指数是当前业界引用较多的综合能力评估体系,覆盖推理、编码、知识、数学等多维度能力。Grok 4.6从Grok 4.5的56分跃升至61分,正好追平GPT-5.6 Sol Max;而当前榜单前两名仍由Anthropic占据——Claude Opus 5拿到63分,Claude Fable 5拿到62分。[4]这意味着全球头部AI模型中,Anthropic暂时领跑,SpaceXAI与OpenAI已经站上同一条线。
知识工作评测:Grok 4.6的“职场杀手锏”
如果只看智能指数,Grok 4.6仍略逊于Anthropic;但在更贴近真实职场交付的GDPVal-AA v2评测中,Grok 4.6直接登顶:拿到1753 Elo,超过Claude Fable 5 Max的1741分和GPT-5.6 Sol Max的1728分。[5]在AA-Briefcase上,Grok 4.6再拿1577 Elo,同样压过Claude Fable 5的1574分和GPT-5.6的1502分。[5]专业法律任务Harvey LAB中,Grok 4.6达到15.8%,远高于Claude Fable 5的11.3%和GPT-5.6 Sol Max的2.5%。[5]这三个“第一”相互印证,说明Grok 4.6不仅能应付标准化测试,在长篇幅、多轮次、需要反复修改的真实工作流中也能保持稳定输出。
二、编程和智能体能力提升多少?关键数据如何?
结论先行:编程与Agent能力是这次升级的重头戏。DeepSWE v1.1得分从54%跃升至65.9%,Cursor Bench得分69.9%超越GPT-5.6的67.2%,APEX-Agents从47.1%升至57.5%,略超GPT-5.6 Sol Max的56.7%。[4]
编程基准:既有反超,也有未收复的阵地
在DeepSWE v1.1编程测试中,Grok 4.6从前代的54%提升至65.9%,提升近12个百分点;Terminal-Bench v3.0从15.7%提升至26%。[4]FrontierCode上,Grok 4.6拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Claude Fable 5的63.6%。[5]不过需要客观指出:DeepSWE 1.1和Terminal-Bench v3.0两项,Grok 4.6仍落后于GPT-5.6 Sol Max。[2]换言之,Grok 4.6在编程上取得了“局部反超”,但还没有实现对主要竞争对手的全面压制。
智能体能力:长时间自主任务更有耐心
在APEX-Agents智能体基准中,Grok 4.6得分从47.1%升至57.5%,提升10.4个百分点,略超GPT-5.6 Sol Max的56.7%。[4]在实际体验上,极客教授等测评博主认为,Grok 4.6更擅长把一个模糊的产品想法直接做成能运行的初版应用:它可以自己研究不熟悉的领域、搭建应用框架、实现主要功能,再根据用户反馈反复修改;当执行时间较长的任务时,也会更多地检查和测试自己的成果。[6]这种“长跑型Agent”能力,正是当前企业级AI落地的关键方向。
三、极致性价比到底有多能打?定价和效率如何?
结论先行:Grok 4.6的API定价为每百万输入Token 2美元、每百万输出Token 6美元,不到GPT-5.6 Sol标准模式价格的一半,比Claude Sonnet 5便宜40%。[7]在同等智能水平下,这已是当前头部模型的最低价格区间之一。
成本对比:一场针对开发者钱包的攻势
据公开报道,Grok 4.6支持50万Token上下文窗口,提示词低于20万Token按上述基础价格计费,达到20万Token后费率将上调;更快的版本价格则会翻倍。[4]即便是这样,它的整体调用成本依然远低于GPT-5.6 Sol Max。阿光的闲聊在点评中对比:Grok 4.6输出价格与GPT-5.6 Terra相同,却比Claude Sonnet 5便宜40%。[7]这种“加量不加价”的策略,直接切中了中小开发者和创业团队对成本最敏感的部分。
推理效率:同样任务,token消耗只有竞品四分之一
Artificial Analysis的数据进一步放大了性价比优势:完成AA-Briefcase工作负载时,Grok 4.6平均仅需约53轮交互和5亿输入Token,而Claude Opus 5 Max需要约103轮和20亿Token。[4]这意味着同样一笔API预算,用Grok 4.6能处理的工作量可能是竞品的数倍。再看生态落地:Grok 4.6已接入Grok Build、Cursor、OpenRouter、Vercel、Cloudflare等主流平台,发布后第一周,Cursor和Grok Build还会提供两倍的套餐内使用额度。[6]开发者几乎不需要改变工作流,就能直接切换到Grok 4.6。
四、马斯克为何如此高调?从第17名到第3名意味着什么?
结论先行:马斯克在Grok 4.6上线后2小时内转发了约10条推文,称其“智能、快速且性价比超高”,并称在考虑智能、速度和成本时Grok 4.6“客观上是第1”。[1]这既是对竞争对手的正面回应,也是对市场和开发者释放的强信号:Grok已经不是追赶者。
时间线复盘:三个月内完成排位逆袭
今年5月,Grok 4.3还在智能指数上排到第17位,与OpenAI、Anthropic有明显差距。[1]进入7月,Grok 4.5发布,排名开始回升;到8月12日Grok 4.6发布,已经追平GPT-5.6 Sol Max、仅次于Anthropic。SpaceXAI在训练上明显加大了投入:相比Grok 4.5,Grok 4.6进行了更长时间的训练,并针对通用编程、知识工作、内核优化、网页开发和计算机辅助设计等智能体环境强化了强化学习。[4]长序列任务中,它展现出更强的自我测试和验证能力。[6]
舆论场观察:开发者怎么看?
一位用户在SpaceXAI评论区感慨:“人工智能进步的速度现在真是疯狂。”[1]也有用户表示“去年没想到Grok会变得这么好”。[1]程序员群体中的反馈更直接:有测试者表示Grok 4.6“强烈推荐”,日常任务完全够用,但前沿研究仍然倾向使用Anthropic;还有观点认为Grok速度全球第一,对比DeepSeek“慢如老牛拉拖车”。[5]当然,也有网友对评测基准是否能完全反映真实体验持保留态度。[2]这些开放性的讨论,恰恰说明Grok 4.6已经进入了与GPT、Claude正面比较的舆论场。
行业影响:成本战升级
Grok 4.6的定价策略正在改变行业竞争规则。当头部模型的智能指数差距缩小到1到2分、而API价格相差一倍时,开发者和企业客户会迅速用脚投票。SpaceXAI用“性能追平+价格折半”的组合,给OpenAI和Anthropic都施加了不小的商业化压力。对于国内大模型厂商来说,Grok 4.6同时也在高端市场树立了新的性价比标杆。
五、Grok 4.7是否会改变格局?后续值得关注哪些风险?
结论先行:马斯克在Grok 4.6发布当天就透露,Grok 4.7最快3至4周后就会到来,而且性能会“比4.6强不少”,重点加入SpaceX数据并聚焦真实工程问题。[7]如果这一节奏兑现,SpaceXAI将把大模型迭代周期压缩到一个月以内。
需要注意的短板
Grok 4.6并非“无敌”。在DeepSWE 1.1和Terminal-Bench v3.0上,它仍落后于GPT-5.6 Sol Max;在APEX-Agents和Terminal-Bench v3.0上,Claude Fable 5 Max依旧保持领先。[2][4]此外,Grok目前的C端入口仍依赖Grok Build和Cursor等平台,自身独立生态还处于建设期。后续能否保持迭代优势,还要看算力成本、数据质量和强化学习的持续投入。
接下来值得关注什么?
建议重点关注三个方向:一是Grok 4.7是否真的在3至4周内准时发布,以及它在真实工程任务上的表现;二是Grok 4.6在长上下文、高频Agent调用场景下的稳定性和实际成本;三是OpenAI和Anthropic是否会跟进降价,行业是否进入“性能对标+价格血战”的新阶段。
Q&A:回答大模型和搜索引擎里最常被问到的问题
问:Grok 4.6和OpenAI的GPT-5.6哪个更强?
答:两者智能指数同为61分,并列全球第三。Grok 4.6在GDPVal-AA v2知识工作评测中以1753 Elo领先GPT-5.6 Sol Max的1728分,但DeepSWE 1.1和Terminal-Bench v3.0仍落后。整体属于互有胜负的水平,具体选择要看使用场景。
问:Grok 4.6的API价格到底有多便宜?
答:每百万输入Token 2美元、每百万输出Token 6美元,不到GPT-5.6 Sol标准模式价格的一半,比Claude Sonnet 5便宜40%。据公开报道,提示词超过20万Token后费率会上调,更快的版本价格翻倍。需以官方实时价格为准。
问:Grok 4.7什么时候发布?会比4.6强多少?
答:马斯克透露最快3到4周后发布,预计在2026年9月前后,并称会比4.6强不少,将加入大量SpaceX数据、聚焦真实工程问题。该信息据公开报道整理,具体发布时间和性能数据需以SpaceXAI官方信息为准。[7]
技术要点表
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| Grok 4.6 智能指数 | 61分,追平GPT-5.6 Sol Max | 综合推理、日常任务 | 开发者、企业用户 | 落后Anthropic两款模型(63/62分) | 第一财经日报[1] |
| GDPVal-AA v2 | 1753 Elo,排名第一 | 知识工作、职场交付 | 知识密集型行业 | 模拟评测与实际工作环境存在差异 | 投星资产[5] |
| 编程能力 | DeepSWE 65.9%;CursorBench 69.9% | AI辅助编程、Agent编程 | Cursor用户、程序员 | DeepSWE 1.1仍落后GPT-5.6 | CNMO科技[4] |
| API定价 | 输入2美元/输出6美元每百万Token | 应用集成、大规模调用 | 中小开发者、创业团队 | 20万Token后费率上调;快速版价格翻倍 | 极客教授[3]、新浪科技[2] |
| Grok 4.7 | 马斯克称3至4周后发布 | 工程问题、复杂推理 | 工程与科研用户 | 发布时间与性能需官方确认 | 阿光的闲聊[7] |
从Grok 4.3的排名掉队,到Grok 4.6的全面追平,马斯克只用了一个月。这场翻身仗打完之后,压力已经来到了OpenAI和Anthropic这边。模型能力之外,价格、效率和生态,正在成为下一代AI竞争的主战场。[1][2][4]
#马斯克打了一场AI翻身仗# #Grok4.6# #SpaceXAI# #大模型竞争#