电动知士大雨
26-09-15 19:03 微博认证:汽车博主

看完先明谈小鹏 XOS 6.3.0 的文章,我比较关注双 Orin X 蒸馏的部分。

它解释了两个问题:把 VLA 2.0 部署到低算力平台,需要做哪些工作;在降低计算开销的同时,怎么尽量保留模型能力。

其中一句话很关键:双 Orin 的蒸馏涉及“跨平台 / 跨模型架构”,需要“对底层甚至是算子层面做更彻底的优化”。

这很可能是双 Orin X 版本需要更多时间的一个重要原因。除了蒸馏训练,小鹏还需要完成针对这套硬件的适配。

具体做了什么?文章披露了几项工作。

第一,重构计算开销最大的视觉部分。

在 Max 蒸馏的整体方案里,小鹏针对计算量最重的 ViT 进行了彻底重构,以 HybridViT、TuringViT 等工作为基础,通过“学习式压缩”降低计算量,尽可能保留模型后续处理的容量。

低算力平台的资源有限,视觉处理消耗多少计算,会影响其他部分能够分配到多少资源。因此,蒸馏之前,学生模型自身的架构就需要调整。

第二,针对芯片优化模型的运行方式。

模型经过训练,还需要在车端满足运行时延要求。文章提到的编译器、部署和算子优化,都是为了提高目标硬件的利用效率。

双 Orin X 涉及跨平台、跨模型架构适配,因此需要更深入的优化。这部分工作的难度,在于既要保留能力,又要在老平台上跑的动。

第三,同时提高教师模型和学生模型的能力。

更强的教师能够提供更丰富的学习信号;学生模型则需要有足够的容量和合适的架构,才能学到这些能力。因此,小鹏也在提高学生模型蒸馏前的基础能力。

这意味着,蒸馏效果取决于教师、学生和训练方式的共同作用。

6.3.0 基座模型具备长时序、未来预测等能力,但双 Orin X 蒸馏版保留到什么程度,官方没有披露。按照既往的蒸馏案例(V14 lit、NWM),我的个人判断,大部分的基础能力类似,但在长尾场景、响应延迟以及感知范围上,可能会略有差异。

第四,把训练资源优先用于日常高频场景。

Ultra 和 Max 的定位做了明确的能力划分:Ultra 持续拓展场景覆盖、长尾处理和跨区域泛化,长期目标是向 L4 能力演进;Max 聚焦通勤与日常使用。

相应地,Max 会通过训练数据的选择和分布,让有限资源优先用于高频场景。这是它尽量保障日常体验的一项具体做法,也说明不同版本之间存在能力取舍。

一句话总结:小鹏针对蒸馏,做了重构学生模型、降低视觉计算开销、优化底层运行效率、增强教师和学生能力,以及调整训练数据分布。

此前,我们的车主群出现过,蔚来老用户“排队”给斌哥“隔空道歉”的盛况,不知道这次双OX推送后,小鹏能否获得老Max用户的认可,是否也会出现类似的情况呢?

我还蛮期待的[doge]。

发布于 北京