云端演进窗
4小时前来自 科技看点

王兴兴为何更看好视频生成驱动路径?

一、技术瓶颈的归因:模型架构才是关键

王兴兴在多个公开演讲中反复强调,当前限制人形机器人大规模应用的最大障碍并非硬件,而是具身智能AI模型本身不够用。 他指出,目前全球业界对机器人数据的关注度有些过高,真正的问题反而出在模型架构上——模型架构不够好、不够统一,导致即便采集了大量数据,也往往“用不起来”。

这一判断与他对硬件水平的基本评估密切关联:王兴兴认为,无论是整机还是灵巧手,目前的硬件在技术层面上完全够用,更大的挑战在于量产工程而非AI能力本身。 正因如此,他才会将突破口锁定在模型架构的创新,而非等待硬件成本进一步下降。

二、对VLA模型的反思:依赖高质量数据,适应性差

VLA模型(视觉-语言-动作模型)是当前业界广泛应用于具身智能和人形机器人的主流技术路线,但王兴兴对此持明确的怀疑态度。他在2025年世界机器人大会上公开表示,VLA模型属于“相对傻瓜式的架构”。

他分析指出,VLA模型在与真实世界交互时,对高质量数据的依赖程度极高,而机器人领域获取干净、标注完整的数据集远比语言模型从互联网爬取文本要困难得多。 物理解世界无法像文本世界那样提供海量、低成本的训练素材,导致VLA模型在陌生环境中的泛化能力严重不足。“很多情况下数据有了,会发现这个数据用不起来。”

三、视频生成模型的核心优势:绕过数据瓶颈

与VLA模型形成鲜明对比的是,视频生成模型(或世界模型)提供了一条截然不同的技术路径。王兴兴认为,这条路线虽然看似路径更长——先生成一段机器人完成任务的视频,再把视频中的动作翻译成实际执行的控制信号——但收敛概率更大,发展速度也有望更快。

其逻辑基础在于:视频生成模型天然具备对物理世界时空规律的学习能力,通过对大量视频数据的预训练,模型可以在虚拟环境中推演“如果做某个动作,世界会有怎样的变化”,从而实现从“理解世界”到“指挥行动”的转化。 OpenAI和谷歌相继发布的视频生成模型,都让王兴兴看到了“控制视频生成模型去驱动机器人”这一朴素想法的可行性。

四、宇树科技的实践验证:从生成视频到控制机器人

王兴兴在演讲中分享了一个关键案例:宇树科技很早就开始探索视频生成驱动路径,并用一个预训练的视频生成模型做了实验。 具体做法是,先用模型生成一个机器人整理房间的动作视频,再将生成视频中的动作序列直接映射为控制信号,驱动真实机器人去完成任务。实验结果证明,“这个技术是能实现的”。

他特别提到,谷歌发布的全新一代视频生成世界模型,其“生成-控制”架构与宇树科技探索的方向具有高度一致性,都是将机器人的动作序列控制直接对齐到视频生成模型架构上。 这种路径能够有效避开了VLA模型“有数据但用不起来”的尴尬。

五、对GPU消耗的理性审视:不必过度追求生成画质

视频生成模型也存在自身的问题,最突出的是对GPU算力的消耗极大。王兴兴坦承,“视频生成模型太关注视频生成的质量了,导致对GPU的消耗有点大”。

但他同时指出,对于机器人干活这个应用场景而言,视频生成质量并非越高越好。“某种意义上你并不需要很高精度的视频生成质量,你只要驱动机器人去干活就行了。” 这也就意味着,通过针对性优化——降低生成画质要求、减少不必要的渲染细节——视频生成模型的算力消耗可以被大幅压缩,使其在机器人本体或边缘服务器上的部署成为可能。

六、路径选择的深层逻辑:寻求模型架构的通用性

综合来看,王兴兴更看好视频生成驱动路径,绝非简单的技术偏好,而是围绕“模型架构通用性”这一核心命题作出的战略判断。VLA模型加强化学习的训练范式,虽然自然且直观,但始终无法解决数据利用效率低和跨场景迁移能力差的根本问题。 而视频生成模型通过先建立对物理世界的通用理解、再适配具体动作输出,在架构上具有更强的统一性和泛化能力。

正如王兴兴所说,机器人目前在强化学习的Scaling Law(扩展定律)上“还没有人做出来,做好”。 他认为,如果行业只在VLA框架内“堆数据”,而忽略模型架构本身的创新,可能会在一场“看似热闹却绕远”的竞赛中耗费过多时间。