XP-Candice婷婷
26-06-03 11:25 微博认证:小鹏集团自动驾驶及智能座舱产品负责人、Robotaxi 负责人

From Xianming:

我们在陆续发布了 X-World 和 XCache 之后,这是我们关于世界模型的又一个工作。几个工作之间有相互连续性,也是我们在物理 AI 上的逐步探索

我们一直认为不管是 VLA 还是世界模型,本质都是希望通过尽量自监督或者辅助监督的形式,能得到更好的物理世界基座模型。它们本质上是在做同一件事:通过 scaling model、scaling data、scaling objective,训练一个足够强的 Physical World Foundation Model,让模型真正理解物理世界,并且能够在真实世界中行动。

VLA 的监督信号来自人类行为。

输入是视频流 + instruction / prompt,输出是 action sequence 或者直接控车信号。这个监督信号是稀疏的,但语义层级非常高。因为人的驾驶动作背后,已经隐含了感知、推理、意图、风险判断、社会交互和物理世界理解。

World model 的监督信号来自世界本身。

它不只是预测人的 action,而是预测未来的状态、未来的观测,或者未来的 latent representation。它的监督信号更加密集。每一帧、每一个运动、每一次交互,都可以变成训练信号。

所以我并不认为 VLA 和 world model 是两条互相竞争的路线。

VLA 学的是:人在这个世界中会怎么做。
World model 学的是:这个世界本身会怎么变化。

它们的目标都是为了得到一个更强的 foundation model

明天 CVPR 2026 http://t.cn/AXXcfMAc 我会进一步分享我们的一系列工作以及我们的思考

发布于 上海