
王兴兴为何说人形机器人的泛化能力是全球难题?
王兴兴在携其载人机甲GD01登上《时代》杂志封面时,明确指出人形机器人的“泛化能力”是整个全球科学界最头疼的问题,这一判断源于技术底层尚未突破模型架构与物理世界数据交互的双重瓶颈。
一、何谓“泛化能力”与“ChatGPT时刻”
王兴兴在多个场合清晰定义了机器人的技术临界点:当一台人形机器人被带入完全陌生的环境,仅凭一句语音指令,就能自主完成将一瓶水递给特定观众或整理房间这类通用任务,这便是人形机器人的“ChatGPT时刻”。 他给出的具体量化标准是——在80%的陌生场景中,通过语言或文字指令,机器人能够顺利完成大约80%的任务。
二、技术现状:从炫技到干活的巨大鸿沟
1. 运动能力的快速进步
过去几年,人形机器人从行走到跳舞、功夫格斗乃至简单服务,进步可谓飞速。 宇树的人形机器人甚至能展现全套中华武术动作,腾空、翻转、闪避与攻防博弈均已实现。 这些成果让机器人频频登上春晚、超级碗等舞台。
2. 干活能力的真实瓶颈
尽管运动表现惊艳,王兴兴反复强调,指望机器人在真实的干活场景产生较大价值,目前还不太现实。 宇树科技发布的视频中,机器人展示了通过语音交互完成拿取物品、整理衣物等家务操作, 但这类执行仍高度依赖预设的实验室环境。一旦场景变换、物件位置偏移或光照条件改变,机器人的表现就会急剧下降。

三、泛化能力为何成为全球难题
1. 模型架构的先天缺陷
王兴兴认为,当前行业最大的误区是对数据问题的关注度过高,而真正的症结在于模型本身。 主流的VLA(视觉-语言-动作)模型在他看来属于“傻瓜式架构”,其对真实世界交互的数据质量远不够用。 即便在VLA模型基础上叠加强化学习(RL)训练,宇树科技长期实践下来的结论依然是“不够用”,模型架构必须继续升级优化。
2. 物理世界数据的稀缺性
与语言模型可以从互联网海量文本中获取训练数据不同,机器人面对的是物理世界。机器人必须在真实环境中交互,才能采集有效数据,但这些数据天然稀缺且采集成本极高。 天使投资人王兴兴形象地比喻:语言模型依赖的是“有字的纸”,而机器人AI需要的却是“无字的现实”。
3. 强化学习Scaling Law尚未突破
在语言模型领域,扩大数据量和算力就能带来性能提升的Scaling Law已得到充分验证。但在机器人运动控制领域,这一规律几乎是从零开始探索。 例如训练机器人跳一段新舞蹈,每次都得从头训练,无法在已有成果上叠加进步。王兴兴直言,行业内机器人RL的Scaling Law“没有人做出来,做好”。
4. 视频生成模型路线的挑战
王兴兴透露,宇树科技和谷歌都在尝试用视频生成模型(或世界模型)直接驱动机器人。 这条路线可能比VLA模型收敛概率更大,但视频生成模型过度关注画面质量,导致GPU消耗极大。对机器人干活而言,并不需要高精度的视频输出,“让机器人去干活”才是核心诉求。
四、时间表:务实的技术预期
1. 2到10年的窗口期
王兴兴在《时代》采访中给出了谨慎的时间判断:人形机器人的“ChatGPT时刻”可能还需要2到10年。 这一跨度充分体现了技术的不确定性。
2. 乐观与现实的平衡
在2026年世界互联网大会上,他判断最快可能在2到3年内迎来技术临界点。 而在其他场合,他给出的预期是快则1到3年,慢则3到5年。 综合来看,王兴兴的态度始终务实——“硬核科技的突破是需要时间的”。
五、探索不止:逼近临界点
1. 攻克“大脑”与“身体”
宇树科技正全力攻关两个方向:一是端到端的具身智能AI模型,二是更低成本、更高寿命的硬件。 公司绝大多数员工都在为训练机器人在各场景干活而努力。
2. 真实场景的历练
王兴兴相信,机器人不能只在实验室里转圈,必须到真实世界中磨合历练。 从春熙路的街头机甲格斗到工厂中的试点应用,宇树科技正通过一次次真实场景的反馈来逼近那条技术临界线。当机器人真正跨过“泛化能力”这道门槛时,才有望从舞台走向千家万户。