杨骏驱
26-06-04 22:53 微博认证:科技博主

【物理世界基座模型是实现物理AI落地,通往物理AGI的必经之路】
一个月前我分享过米良川LC回到中国科技大学分享小鹏机器人的个人感想,为此写了一篇长文,链接→http://t.cn/AXX61T6K

里面提到关于AGI的表述:
AGI 的标准从头到尾都是复刻 / 对齐人类智能全集:
跨领域通用学习(人像啥都能学)
无监督举一反三(人不用海量标注)
常识、推理、创意、情感、价值判断
自我认知、意图、长远规划

回顾来看,米良川多次提到人文边界,人文价值,探索人与机器共生的未来文明形态,其实他想做的是人的自我复刻,他想做的是“人”。想要把“人”做出来,除了机器人本体的关节,仿生皮肤,仿生骨骼,仿身肌肉,最重要的还是物理世界基座模型,也就是机器人的大脑中枢,决定了机器人如何感知,如何看待,如何思考,并对此如何作出行动,反应,预判和推理。

而小鹏集团最近发布了最新的命名为X-Foresight的论文:学习世界知识赋能智驾,开创预测模型新范式,本质上也是为自动驾驶的物理世界基座模型赋予了新的人类意图、感知、风险判断,预判推理世界行为,决策行动能力;

X-Foresights是一套基于预测式世界模型(Predictive World Modeling)的视觉-动作因果预测网络。X-Foresight 把世界建模直接嵌入自动驾驶的 VLA架构,通过联合预测未来画面与驾驶动作,从海量真实驾驶视频中习得物理世界的运行规律,更好执行控车决策,实现驾驶能力的本质跃升。

X-Foresight 与此前发布的 X-World(多视角世界仿真)、X-Cache(世界模型推理加速)形成完整技术闭环:

X-World 负责虚实映射与场景推演,提供可供策略训练的仿真环境,能在给定动作条件下生成符合物理约束的未来视频,同时在持续生成过程中保持良好的可控性与稳定性,相当于坐进主驾驶位置,输入了驾驶的参数,给AI造了仿真马路的场景,随时切换的行人,汽车以及周边的动态,模拟各种路况(鬼探头,恶意加塞,暴雨打滑);

X-Cache 提供无损推理加速,能在基本不牺牲画质的前提下,减少约七成的重复计算,对世界模型的去噪主干实现最高约 2.7 倍的推理加速;

X-Foresight 从海量视频中习得世界知识,实现更优驾驶决策,在架构上与VLA融为一体,在统一的 token 空间内联合预测未来的多视角画面与自车动作,为 VLA 的控车决策提供了核心支撑,相当于我在这样开,3秒后路面,行人,车流会有什么变化;

此外,小鹏即将发布“X-Mind”的技术报告,解析模型如何“主动思考”,并可视化地呈现驾驶决策背后的中间推理过程。可解释性对于自动驾驶的软件性能调试、用户信任建立以及模型快速迭代都至关重要。

三者协同构建 “知识学习 - 场景仿真 - 推理加速” 全栈体系,为小鹏自动驾驶模型训练、仿真验证、持续迭代提供全链路技术支撑。

最终的目的是什么?打造一个有思维,有意识,提前预判,提前推演物理世界的基座模型,从强化学习、模仿学习、实战环境更接近现实中加速从“旧式辅助驾驶:看见了再反应”向“新式自动驾驶:提前预测世界怎么变化提前做反应”

感知被动反应-模仿人类驾驶行为-超越人类驾驶行为-预判世界行为演变-远远超越人类驾驶的安全性-无限趋近于0的事故率,这是也许是L2通往L4的进程;

过去一两年,研发团队通过提升模型、算力、数据的规模,不断摸高基座模型的性能。目前,小鹏第二代VLA模型拥有数十亿参数量,使用了上亿的视频片段作为训练数据,每版模型的训练量超过4万亿 Token。

小鹏是国内最早建成万卡以上规模智算集群的企业,在截至今年3月的一年间,小鹏集群的单GPU训练效率提升了1010%、单任务训练效率提升了4360%,GPU硬件利用率从40%提升到了90%,达到头部AI公司的标准。

坚持有限的资源提高基础建设的训练效率,榨干每一张算力卡的性能。

“自动驾驶汽车可以认为是一台自动 machine,它自己使用 token。物理世界里,未来要看 machine 自己使用多少 token,产生多少对 machine 和人的价值;而人使用多少 token,产生多少对人和企业的价值,是另一个维度。它们的指标应该不一样。”

坚持建设一个大一统的物理世界基座模型,比一个由多个小模型构成的缝合怪模型,具有更大的意义,在不同的场景下具有更好的泛化能力,有更加一致性的场景能力和更平稳,更安心,更丝滑的驾乘感受,也许这是token消耗创造对人和企业的价值,不仅仅是数字世界消耗更多的token提高工作效率,为了使用AI而消耗token,把token转化为用户可感知的舒适体验,转化成对物理世界改造的价值,这时候才可以说token不仅仅是消耗,而是真实价值,才是始终对标L4自动驾驶而做的正确事情;

物理世界基座模型在未来不仅仅具备上下文,视觉,传感器触觉,还具备听觉,长时序的思维预判,多维世界感知力,引用@不是郑小康 关于特斯拉FSD是一个很好的案例:

输入是 20 亿的 Token:

1. 7 个摄像头 x 36帧/s x 500 万像素 x 30s 的上下文记忆/5x5的像素
2. 未来几公里的导航信息
3. 100 Hz 的车辆动态数据,包括速度、IMU、里程计等
4. 48 Hz 的音频数据

输出是 2 个 Token:

下一秒的转向和加减速信号

模型要在每一时刻都得学到从输入的 20 亿 Token 到输出的 2 Token 的正确因果映射关系,这个压缩的过程就会产生智能,这一刻,涌现具象化了,AI的意义具象化了;

小鹏认为优秀的世界模型必须具备的三大能力:主动思考、可控生成和长时序推演,这是智能的体现,也是世界模型能在自动驾驶领域应用的前提条件。也在通过自己的范式,实现自己全方位物理AI的在不同物理形态和载体路上。

今日,全球计算机视觉顶级学术会议CVPR 2026(The IEEE/CVF Conference on Computer Vision and Pattern Recognition)在美国科罗拉多州丹佛开幕。

这也是小鹏集团第三次受邀登上这一被誉为“计算机视觉奥斯卡”的国际顶级学术舞台。

作为唯一受邀演讲的中国企业代表,小鹏集团通用智能中心负责人刘先明出席CVPR首届具身智能基座模型部署研讨会(WDFM-EAI)做主题演讲,与特斯拉、英伟达、Waymo等全球物理AI领域的同行同场竞技,以及加州大学、多伦多大学等顶尖高校和研究机构的专家学者同台交流。

小鹏如此高规格地在国际舞台亮相,输出小鹏在物理AI领域的独特思考,打造自己在物理AI领域的全球声量,相当于国产智驾底层路线拿到全球顶尖专家认可,是国内车企第一次亮出量产装车+仿真训练闭环全链路技术方案。

正式参会前刘先明发了个朋友圈,里面提到的观点我非常认同,我把他总结为:
世界模型(World Model):学习世界本身怎么运转,不靠人开车数据,盯着路况里所有物体移动、环境变化自学,预判路面接下来会发生什么,路面每一帧画面变化都是它的练习题。

最终目的一致:VLA 学会人的驾驶思路、世界模型摸清世界运行规律,两者融合,造出真正懂现实世界、能稳妥自动驾驶,得到一个更强的Physical World Foundation Model。

不是消耗了Token就叫AI,不是用AI做了Coding就叫AI,而是打造一套行之有效,逻辑自洽,可持续进化的体系,并促进各种形式的AI在物理世界的落地,无论是机器人还是自动驾驶,把人类从重复性、危险性的劳动中解放出来,把精力投向创造性的工作,这叫生产力的解放,也是AI的真谛;

汽车行业现在是在血海里游泳,拿出好的自动驾驶产品算不算游出血海?
机器人开局是蓝海还是血海?
物理AI的斗争刚刚开始,就嗅到了腥风血雨的味道,到底是百花齐放,还是赢家通吃?我们且走且看。

#小鹏特斯拉英伟达高管同框# #小鹏第三次受邀出席国际学术顶会cvpr# #小鹏汽车[超话]#

发布于 广东