硅域亲历录
12小时前来自 科技看点

王兴兴认为机器人突破核心短板是什么?

王兴兴在2026年世界互联网大会上明确表示,机器人突破的核心短板并非硬件,而是具身智能AI模型的泛化能力不足,当前模型架构不够统一、数据利用效率低,类似于ChatGPT发布前1-3年的状态,预计2-3年内迎来技术临界点。

一、核心短板:AI模型而非硬件

王兴兴在多次公开演讲中强调,当前人形机器人大规模应用的最大障碍不是硬件,而是具身智能AI完全不够用 。

他认为目前的机器人硬件——包括整机和灵巧手——从技术角度已经“完全够用”,虽然量产工程化仍有优化空间,但AI模型的落后才是制约发展的关键 。

他将当前阶段比喻为“ChatGPT诞生前的1-3年”,业界已发现技术路线和方向,但尚未有人做出能够统一感知与执行的端到端智能大模型 。

二、当前模型的困境:架构不统一、数据被过度关注

王兴兴指出,现在行业对数据问题关注过高,而忽略了更根本的模型架构问题 。

许多团队认为只要拥有足够多、足够好的数据就能训练出优质模型,但在具身智能领域,数据往往“用不起来” —— 即使采集了数据,也无法有效驱动模型进步 。

他对当下流行的VLA(视觉-语言-动作)模型持“怀疑态度”,认为这是一种“相对傻瓜式的架构”,在与真实世界交互时数据质量和采集能力都不够用 。

即使在VLA模型上叠加强化学习(RL)训练,宇树科技的实践也表明效果仍然不足,模型架构需要进一步升级和优化 。

三、突破方向:视频生成模型、世界模型与RL Scaling Law

王兴兴更看好视频生成驱动技术路径,认为这可能比VLA模型收敛更快 。

他举例说明:通过预训练的视频生成模型生成机器人动作视频,再转化为实际控制信号,这一技术在宇树已得到初步验证 。

但该路线面临GPU算力消耗大的问题,不过机器人干活并不需要极高精度的视频质量 。

另一个关键方向是强化学习的Scaling Law —— 目前训练新舞蹈或新动作时仍需从头开始,无法实现跨任务的知识积累,而这一规律在语言模型领域已被充分验证,但在机器人运动控制上才刚刚起步 。

他认为未来2-5年智能机器人技术的重心将是端到端的具身智能AI模型,同时需要更低成本、更高寿命的硬件以及分布式算力架构 。

四、临界点时间表与全球共创

王兴兴将“ChatGPT时刻”定义为:在完全陌生的环境中,机器人仅凭语音指令就能自主完成80%以上的任务 。

他预测这一临界点最快在1-2年或2-3年内实现,最慢也大概率在3-5年内突破 。

他强调,这一突破无法靠单一企业实现,需要全球协作、开源共享,共同攻克模型瓶颈 。

王兴兴呼吁各方提前做好计划和安排,在技术拐点来临时才能把握智能时代的新机遇 。