数码新声
6小时前来自 科技看点

王兴兴认为当前机器人的技术瓶颈在哪?

在2026年世界互联网大会数字丝路发展论坛上,宇树科技创始人王兴兴明确指出,当前机器人产业最大的瓶颈并非硬件,而是具身智能AI模型能力严重不足,这一阶段类似于ChatGPT诞生前的1-3年,但他判断技术临界点最快2-3年内有望突破。

一、核心瓶颈:AI模型而非硬件

王兴兴在多场公开演讲中反复强调一个核心判断:当前限制机器人大规模应用的最大问题不是硬件。

1. 硬件已基本够用

王兴兴认为,当前的机器人硬件,包括整机和灵巧手,从某种意义上来说已经是完全够用的。虽然硬件仍有优化空间,工程上的量产问题也存在,但从技术层面或AI角度出发,硬件不再是主要制约因素。

2. 具身智能AI严重滞后

王兴兴指出,目前最大的挑战在于具身智能的AI完全不够用,这是限制人形机器人大规模应用的关键。他甚至直言“目前AI模型难以真正驱动机器人做事”。他将当前阶段比作ChatGPT诞生前的1-3年——业界已发现类似方向和路线,但没有人能把成果做出来。

二、模型问题被低估,数据问题被高估

在探讨瓶颈成因时,王兴兴提出了一个与主流认知不同的观点。

1. 模型架构不统一、不够好

王兴兴认为,当前全球范围内对数据问题的关注度太高,而模型问题才是真正的核心。在具身智能和机器人领域,模型架构都不够好、不够统一,即便拥有大量优质数据,数据也用不起来。

2. 数据困境:采集了却用不上

王兴兴解释了数据困境的根本原因:在机器人领域,很多时候数据有了,却无法有效利用。这与大语言模型不同——后者只要有足够多的优质数据就能把模型训练得越来越好,但机器人的物理交互数据有着天然稀缺性和使用壁垒。

三、对主流技术路线的质疑

王兴兴对当前行业热門的VLA模型明确表示怀疑。

1. VLA是“傻瓜式架构”

王兴兴称VLA(视觉-语言-动作)模型是一个相对傻瓜式的架构,他对这类模型持比较怀疑的态度。他认为VLA模型在与真实世界交互时,数据质量和采集能力都不太够用。

2. VLA+RL仍然不够

宇树科技尝试了在VLA模型基础上加入RL强化学习训练,但王兴兴认为结果仍然不够理想,模型架构还需要进一步升级和优化。

四、看好的方向:视频生成驱动

1. 视频生成模型驱动路线

王兴兴更看好由视频生成模型(或世界模型)驱动机器人控制的技朮路径。他认为这个方向的收敛概率更大,发展速度可能比VLA模型更快。

2. 宇树的实践验证

2024年,宇树已经率先做了相关尝试:利用预训练的机器人动作视频去控制机器人仿照执行。虽然视频生成模型对GPU消耗很大,但王兴兴指出,机器人干活并不需要很高精度的视频生成质量。

五、强化学习Scaling Law缺失

1. 每次训练都从零开始

王兴兴指出,当前机器人领域面临一个突出间题:训练新动作和新舞蹈时,每次都要从头开始训练。理论上,RL训练应该越训练越快、学习新技能的效果越来越好,但目前全行业还没有公司做出并做好机器人的RL Scaing Law。

2. 这是亟待突破的方向

RL Scaing Law在语言模型领域已充分验证,但在机器人运动控制上才刚刚开始。王兴兴认为这是一个非常值得投入突破的方向。

六、技术临界点的定义与时间预期

1. 临界点的量化指标

王兴兴对具身智能的“ChatGPT时刻”给出了明确的量化标准:在80%的陌生场景中,机器人能根据指令完成约80%的任务。具体场景是,带一个人形机器人到从未见过的会场,说一句“帮忙把这瓶水带给某位观众”或“整理一下房间”,它能顺畅自主地完成。

2. 时间窗口

王兴兴判断,快的话1-2年或2-3年就能实现这一目标,最慢3-5年也有很大概率能实现。他呼吁行业不能被动等待技术爆发,眼下就要提前布局规划。

七、全球共创的解决路径

1. 合作而非单打独斗

王兴兴多次强调,AI和机器人领域的创新永远伴随着随机性,没有一家大公司能保证永远领先。他呼吁全球共创,全世界拧成一股绳,机器人技术才能更快突破临界点。

2. 持续投入是关键

他认为,科技的创新和突破在时间上并不是一蹴而就的,要取得突破,最关键的必不条件是持续的创新投入。