# 世界模型进入机器人:生成视频只是第一步
**信源:**2026年Berkeley RDI“Agentic AI Summit”机器人与世界模型圆桌。参会者包括Physical Intelligence联合创始人Sergey Levine、NVIDIA机器人负责人Jim Fan、Sony AI总裁Michael Spranger、Runway联合CEO Anastasis Germanidis和Applied Intuition首席科学家Wei Zhan。本文结合[Runway GWM-1](http://t.cn/AXNITU18)及[Physical Intelligence RLT](https://www.pi.website/research/rlt)等公开资料整理。
过去两年,世界模型逐渐成为机器人研究的热门方向。它通常被描述为让机器“理解物理世界”的技术,但圆桌讨论揭示了一个更严格的问题:能够生成符合人类直觉的视频,是否等于能够预测真实动作的后果?
Runway代表了大规模视频预训练路线。现实视频记录着物体运动、空间关系、遮挡变化和人类操作。只要训练数据足够丰富,模型就可能从像素中学习大量隐含规律,无须工程师预先写入完整的三维几何和物理方程。GWM-1进一步加入相机运动和机器人动作等条件,试图把视频模型扩展为可交互的模拟环境。
Sergey Levine对此提出了更高的检验标准。普通视频模型主要学习什么样的下一帧“看起来合理”,机器人真正需要回答的是:在当前状态下执行某个动作,世界随后会发生什么。
两种能力在常见场景中可能表现相近,遇到罕见动作和失败状态时却会分开。例如,训练视频中的汽车通常沿道路行驶,很少主动撞向建筑。面对异常驾驶指令,模型可能改变画面中的道路或建筑,让视频继续保持连贯,却没有忠实模拟碰撞。画面质量很高,因果关系仍可能是错的。
因此,世界模型不能只用清晰度和人类偏好评价。研究者还要在同一场景中改变动作,检查结果是否相应变化;测试碰撞、摩擦和接触是否符合现实;观察长时间预测是否出现漂移。最终标准仍是模型能否提高机器人的任务成功率。
视频数据本身也存在边界。摄像头能够记录物体外观和运动,却很难完整揭示重量、摩擦系数、夹持力度和材料形变。机器人使用的关节位置、电机电流、力反馈和触觉信号,也无法全部从RGB视频中恢复。视频预训练适合建立广泛的视觉与运动先验,高精度控制仍需机器人本体状态、接触反馈和真机数据。
这使VLA与世界动作模型的分工逐渐显现。VLA擅长理解语言指令、识别对象和分解任务;世界模型负责预测动作与未来状态的关系;底层控制器则依据触觉、力和关节反馈实时修正动作。未来的机器人系统可能采用分层架构:语言模型负责目标和长程规划,世界模型生成候选状态,动作策略输出连续控制序列,传统控制器处理毫秒级反馈。
训练方法也会走向组合。人类示范可以快速教会机器人新技能,但示范数据大多记录正确操作,较少覆盖机器人自己制造的错误状态。机器人一旦偏离训练分布,错误便可能连续累积。强化学习可以让机器人从失败、纠正和重试中改进,但真机训练成本高,也存在设备损坏和安全风险。
Physical Intelligence的RLT研究提供了一种折中方案:保留基础VLA的通用能力,再用少量真机经验训练小型策略模块,专门修正螺丝刀插入、扎带穿孔等精细动作。可靠性仍是难点。假设一个任务包含50个环节,每一步成功率为98%,完整任务一次成功的概率只有约36%。生产环境需要机器人具备识别异常、恢复、重试和安全退出的能力。
真实世界、经典仿真器和神经世界模型因此不会互相取代。真机提供最可信的物理反馈,但数据采集昂贵;经典仿真器运行速度快、参数可控,却需要大量场景和资产工程;神经世界模型能够生成丰富的环境变化,也可能产生不符合真实因果的结果。较现实的路线,是用神经模型扩展场景,用经典仿真器执行可控计算,再以真机数据校准偏差。
商业化进程还要按场景区分。工厂、仓储和物流环境可以限制工作空间、改造流程并持续收集数据,更可能率先实现规模化部署。家庭场景涉及儿童、宠物、软物体、隐私和更高的安全责任,通用机器人的落地时间可能更长。
对于AI基础设施,机器人世界模型会增加视频训练、仿真和连续推理的需求,带动GPU、高速互连、光网络、存储、边缘芯片及多模态传感器的使用。不过,实际增量取决于机器人部署数量、模型运行频率以及云端与本地计算的分工。
世界模型是否真正有效,最终要看系统能否低成本获得新环境、记录有价值的失败,并用较少真机经验修正策略。生成逼真的未来只是一项能力;能够让机器人依据预测采取行动,并接受现实结果的反复检验,才是它走向实际部署的门槛。
发布于 美国
