
视频生成驱动技术路径为何被王兴兴看好?
一、技术临界点近在眼前
王兴兴在论坛上给出了具身智能“ChatGPT时刻”的量化标准:机器人在陌生环境自主完成80%至90%的任务。他判断硬件已经基本够用,核心瓶颈在于AI模型本身,当前水平大约相当于ChatGPT发布前1到3年。这一判断基于宇树科技多年全球出货量领先的实践积累。

二、VLA模型的固有限制
王兴兴对当前行业主流的VLA(视觉-语言-动作)模型持明确怀疑态度。他认为VLA是“相对傻瓜式的架构”,原因包括:
过度依赖高质量标注数据,适应性差,缺乏统一性与泛化能力
在面对陌生场景时需要从零学习,无法做到跨任务迁移
强化学习的缩放定律尚未被证实有效
行业在数据上投入过多关注,却忽视了模型架构本身的局限。很多情况下即使采集了大量数据,也无法有效利用。
三、视频生成驱动路径的革新优势
王兴兴提出两个更值得关注的方向:世界模型与视频生成模型。视频生成驱动路径的核心逻辑是:
先生成一段“完成任务的视频”,再将视频中的动作翻译成实际控制信号
让系统先在虚拟环境中预测物理世界的因果规律,再做决策
具备生成式仿真能力,可以自回归训练,不依赖海量高质量真实数据
在空间理解与长时序建模上更强,能更好应对多样化场景
这一路径的本质是将视频生成从“像素预测”升级为“物理模拟”,使模型理解“为什么这样”而非仅“看起来怎样”。王兴兴认为视频生成模型可能比VLA模型更快收敛。
四、对技术临界点的明确预期
王兴兴预计具身智能的“ChatGPT时刻”最快在1至2年内,最慢3到5年就会到来。届时,一台从未见过某个空间的机器人,能够根据简单指令流畅完成整理房间、传递物品等任务。他多次呼吁全球共创,强调技术创新需要全球合作才能加速突破。

五、工业化落地的关键考量
视频生成路径的另一个优势是适配分布式算力架构。机器人本体最多部署峰值功耗100瓦的算力,而视频生成模型的计算可以依托工厂或社区级的分布式服务器集群完成,既降低延迟又保证安全性。同时,低成本、高寿命的硬件与大批量制造能力将同步推进。
六、总结
王兴兴看好视频生成驱动技术路径,根本原因在于:它绕开了VLA模型对高质量数据的过度依赖,通过世界模型实现因果理解与自我仿真,从而在陌生场景中具备真正的泛化能力。这一路径若能配合全球共创与分布式算力部署,有望在2至3年内让机器人在大部分陌生环境中自主工作,真正实现从“表演”到“干活”的跨越。