
英伟达为何选择自研CPU架构而非继续使用x86?
英伟达选择为Vera CPU自研ARM架构而非沿用x86,核心驱动力在于AI智能体(Agent)工作负载对CPU性能提出了与传统服务器截然不同的要求——x86擅长的“多核并发、高吞吐”不再是最优解,而英伟达需要通过自研架构实现CPU与GPU的极致协同设计,从而在效率、延迟和系统集成上构建竞争对手难以复制的护城河。
一、战略原因:AI工作负载的根本转变
当AI从单纯的“问答”转向复杂的“自主执行”阶段,CPU的角色发生了质变。AI智能体需要执行工具调用、代码执行、数据检索、任务编排等一系列串行工作流,这些步骤依赖前一步的完成,任何一个环节的延迟都会累积放大,拖慢整个系统。
x86架构诞生于通用计算时代,其设计哲学是“在固定功耗预算内同时承载尽可能多的并发任务”,即追求机架级吞吐量密度。然而,在AI工厂中,CPU让智能体等待的每一刻,都意味着最昂贵的GPU处于闲置状态。英伟达的核心论点是,对于Agent工作流而言,单任务完成时间(而非并发任务数量)成为新的瓶颈。
基于这一判断,英伟达抛出了新的性能评估框架:“规模化下的最大单线程性能”。在这一逻辑下,单核性能直接决定GPU利用率——CPU越快,GPU等待越短,系统整体效率越高。这是英伟达选择自研架构的根本战略动机:重新定义AI时代CPU的KPI,从“并发多少”转向“任务多快”。

二、技术原因:性能瓶颈倒逼架构革新
1. 单核性能与内存带宽的极致优化
Vera CPU搭载了88个自研Olympus ARM核心,内存带宽高达1.2TB/s,片上互联带宽达到3.4TB/s。这种设计并非偶然——在AI智能体场景下,高带宽、低延迟的内存访问能力直接决定了CPU处理复杂数据流的速度。英伟达宣称,Vera的单核持续性能达到x86架构CPU的1.8倍,在AI智能体任务中的性能提升约50%。
2. 微架构层面的差异化优势
英伟达在Vera的Olympus核心中引入了名为“Spatial Multithreading”(空间超线程)的先进技术。与传统x86超线程的逻辑线程轮转共享机制不同,英伟达的设计实现了物理执行单元的全隔离共享,避免了一个线程阻塞时另一个线程受影响的问题。这种针对AI推理场景优化的微架构,是x86现有设计难以直接复制的。

3. 系统级协同设计的“全局最优”
Vera并非孤立的产品,而是英伟达Rubin平台的一环,与Rubin GPU、Spectrum交换机、BlueField网卡等共同构成了一套完整的“协同设计”系统。黄仁勋强调,Vera专为尽可能快速处理token而设计,有别于传统云架构中以多实例并行为核心的CPU。
这种CPU+GPU的紧耦合方案,使得Vera Rubin NVL72相比上一代Grace Blackwell,在同样能耗下实现了10倍的Token吞吐提升。在电力受限的AI工厂中,这不仅是性能的提升,更是成本结构的革命。
三、生态与商业前景:开辟2000亿美元增量市场
转向ARM架构并非放弃生态——英伟达的判断是,微架构足够优秀时,指令集兼容性可退居次要位置。
自研架构让英伟达实现了从芯片到系统的全面自主可控。公司强调,Vera是首款从CPU核心开始自主设计的服务器处理器,而非采用ARM提供的现成核心设计,研发投入更高但自主可控程度更强。
商业层面的回报同样显著:Vera CPU已为英伟达打开了此前从未涉足的2000亿美元全新潜在市场,且单颗芯片均价约5000美元,预计在截至2026年1月的本财年创造近200亿美元营收。
首批客户包括OpenAI、Anthropic、SpaceX等顶级AI实验室,CoreWeave、谷歌云、微软Azure等头部云厂商也已开始部署Vera Rubin系统。
四、总结
英伟达选择自研ARM架构而非继续使用x86,是一次基于技术洞察与商业远见的战略抉择。
从技术上看,x86在应对AI智能体高延迟敏感、串行交互的工作负载时并非最优。
从系统上看,自研架构使得CPU与GPU实现前所未有的深度整合,创造出“1+1>2”的能效优势。
从商业上看,这一选择让英伟达从GPU巨头升级为全栈AI基础设施提供商,开辟了全新的增长曲线。
正如英伟达反复强调的,Vera CPU的诞生,不是为了争夺存量CPU市场份额,而是为智能体AI时代重新定义CPU应该是什么样子。这场从x86到ARM的切换,本质上是对算力效率、系统整合与未来话语权的全面重塑。