
当前机器人硬件和AI模型哪个是主要瓶颈?
宇树科技创始人王兴兴在2026年世界互联网大会上明确表示,当前机器人硬件已基本够用,但具身智能AI模型仍是最大瓶颈,并预测2到3年内将迎来技术临界点。
一、硬件已非主要障碍
王兴兴在多场演讲中反复强调,当前机器人硬件在某种意义上“完全是够用的”。无论是整机还是灵巧手,硬件本身已经能够支撑机器人的基本运动和操作需求。宇树科技将人形机器人R1价格从9.9万元降至3.99万元,侧面印证了硬件成本的快速下降和工程化能力的提升。

1. 硬件能力现状
机器人在固定场景、预设程序下可以完成接近100%的任务成功率
宇树G1人形机器人已实现舞蹈、功夫格斗、简单服务等复杂动作
硬件层面足以支撑进一步的AI能力测试与落地

2. 工程化仍在推进
更低成本、更高寿命的硬件仍是未来2-5年的技术重心之一
超大批量制造对工程能力提出更高要求
但这些属于“做更好”而非“能不能用”的问题
二、AI模型是核心瓶颈
王兴兴明确指出,当前限制机器人规模化应用的最大问题在于“具身智能的AI完全不够用”。他将现状类比为ChatGPT诞生前1-3年的阶段:技术方向已被业界认可,但尚无突破性模型问世。
1. 泛化能力严重不足
机器人在训练过的场景中可完成100%任务,但环境一旦变化,成功率就会暴跌
固定任务可以执行得很好,但无法主动适应陌生环境
绝大多数机器人只能在“遥控”或预设程序下工作
2. 模型架构本身存在问题
当前主流VLA(视觉-语言-动作)模型被王兴兴评价为“相对傻瓜式的架构”
即使采集了大量数据,数据也“用不起来”
VLA模型加RL训练后效果依然不够,模型架构仍需升级
3. 数据被过度关注
行业存在误区:以为有足够多高质量数据就能训练出好模型
王兴兴认为“目前最大的问题是模型,并不是数据问题”
在机器人领域,模型架构不够统一、不够好,导致数据价值无法释放
三、技术临界点的定义与时间表
王兴兴为具身智能的“ChatGPT时刻”给出了具体量化标准:机器人在陌生环境中,仅凭语音指令能自主完成80%-90%的任务。
1. 临界点判断标准
机器人进入从未见过的会场,能按要求“把水带给某位观众”或“整理房间”
无需提前编程或专门训练,仅依靠自然语言就能理解并执行任务
泛化能力足够强,能适应大部分陌生场景
2. 时间预测
快速场景:未来1-2年或2-3年
最慢场景:3-5年内大概率可实现
2026年7月世界互联网大会上,王兴兴重申“最快两到三年内”这一判断
四、未来焦点:模型突破与全球共创
王兴兴认为,未来2-5年机器人技术的重心是端到端的具身智能AI模型。他看好视频生成模型或世界模型路径,认为可能比VLA模型收敛得更快。同时,他也强调机器人领域的创新需要全球共创,没有哪一家公司能凭一己之力永远领先。
1. 模型方向
视频生成模型驱动机器人执行任务,宇树已在2024年完成技术验证
解决RL Scaling Law在机器人运动控制上的缺失
构建统一、端到端的大模型架构
2. 产业准备
低成本、大规模算力(分布式)将成为基础设施
硬件需要更低成本、更高寿命以适应百万级量产
鼓励全球协作、开源共享,降低全行业创新成本
王兴兴的判断基于宇树科技作为全球四足和人形机器人出货量最大公司的实践积累。他呼吁全行业“做好准备迎接即将突破的技术临界点”,并指出这一拐点将让机器人从“能运动”真正走向“能干活”,进入千家万户,成为解放生产力的通用工具。