Simple-guy-china
26-06-29 15:42

#地平线#
从算子的角度来看,地平线与英伟达的芯片代表了两种截然不同的设计哲学:英伟达是追求“万能”的通用计算平台,而地平线则是为自动驾驶“定制”的专用处理器。这种根本差异,直接决定了它们在自动驾驶场景下的实际表现。

🧠 算子设计哲学:通用平台 vs 专用引擎
英伟达:通用的“GPU”:其DRIVE Orin、Thor等芯片基于GPU的CUDA架构,优势是能通过CUDA生态和各种AI框架支持几乎所有已知的算子,灵活性极高。劣势在于通用性带来了不必要的功耗和成本开销,且在运行特定自动驾驶算法时,部分算力可能被浪费,即“算力虚高”。

地平线:专用的“BPU”:其芯片核心是自研的BPU(Brain Processing Unit),这是一种为自动驾驶算法定制的ASIC专用芯片。地平线遵循“算法定义芯片”的理念,其BPU架构针对Transformer、BEV等主流智驾模型进行了原生优化。

⚙️ 算子支持与迭代:追赶与引领
算子支持的广度和深度,直接影响算法能否高效部署。

算子数量与类型:地平线最新的黎曼架构,其高精度算子支持数量增加了超过10倍,表明其在努力追赶英伟达的算子丰富度。同时,其架构从Tensor(张量)扩展到了Vector(向量)的全浮点计算支持,以更好地适应Transformer等新算法。

架构迭代:地平线的BPU架构迭代速度很快,从征程5的贝叶斯(Bayes)架构,到征程6的纳什(Nash)架构(开始原生支持Transformer),再到征程7的黎曼(Riemann)架构,每一代都在针对最新的算法趋势进行针对性强化。

🚀 对实际芯片性能的影响:从理论到现实
这种算子层面的差异,最终会体现在芯片的实际性能上。

能效比(FPS/Watt):由于BPU是专用电路,执行特定算子时效率极高。有数据显示,算力仅128TOPS的征程5,在图像处理速度(FPS)上超过了算力254TOPS的英伟达Orin。最新的征程6P更被评价为“算效更是一骑绝尘”。这意味着地平线能用更低的算力实现相同的功能,功耗和成本更低。

算法适配性:随着自动驾驶算法向Transformer-based的BEV感知、端到端模型演进,芯片对这类新算子的原生支持变得至关重要。地平线的J6系列以“BEV+Transformer亲和”著称,而征程7的黎曼架构更是为大语言模型(LLM) 优化,能效提升5倍。相比之下,英伟达的Thor虽然也集成了Transformer引擎,但其GPU通用架构在运行专用模型时,效率可能不如专门优化的BPU。

🛠️ 生态与工具链:开发者的体验
算子最终需要开发者使用,因此生态和工具链至关重要。

英伟达的CUDA生态:拥有无可撼动的地位,开发者众多,算法迁移成本低。其TensorRT工具能自动进行算子融合等优化。

地平线的“天工开物”:提供了对标英伟达CUDA的工具链。其最新的OpenExplorer 4.0编译器引入了AI驱动优化,可将编译速度从小时级提升到分钟级,模型性能提升20%。不过,其BPU生态仍在建设中。

💎 总结
从算子角度看,地平线与英伟达的竞争可以这样理解:

英伟达提供的是功能全面、生态强大的“万能工具”,开发者可以自由实现任何算法,但可能需要为这份“自由”支付额外的功耗和成本。

地平线提供的是针对自动驾驶“精雕细琢”的“专业工具”,虽然在通用性上可能不及英伟达,但在执行特定智驾任务时,能实现更高的效率和更低的能耗。

地平线的策略并非在通用算力上全面超越英伟达,而是通过在特定算子上的深度优化,在能效比和量产成本上建立优势。其“算法定义芯片”的模式,让硬件更贴近实际应用,在竞争激烈的量产车市场,这构成了其独特的竞争力。

发布于 江苏