具身智能大模型何时能成熟?
机器人公司现在最难过的那道坎,不是硬件造不出来,而是“大脑”不够聪明——具身智能大模型还远没到能像人一样在真实世界里自主干活的程度,行业共识是至少还要2到3年才可能迎来类似ChatGPT级别的突破。
一、核心瓶颈:“大脑”而非“躯体”
竞争焦点从硬件转向模型:过去行业比拼的是关节灵活度、抓取精度等硬件性能,但如今市场已意识到,真正决定机器人上限的是模型——只有模型突破了,场景才能爆发。硬件解决的是成本和执行问题,而模型才是“大脑”,决定机器人能看懂什么、听懂什么、做出什么决策。
数据与泛化是硬伤:当前机器人在固定场景里搬运、抓取已能做到80%的人工效率,但一旦物体位置、光线、任务顺序发生变化,系统极易暴露泛化能力不足的问题。有行业观察者直言,具身智能连GPT-1的水平都还没到,因为真实物理世界对手往往“一步错、步步错”。
二、当前进展:模型能力正在加速追赶
全球“大脑”竞赛白热化:智元自研的全模态大模型WITA-Omni在权威榜单DailyOmni上以85.21分登顶,在音视频对齐、时序推理等关键指标上超越了Gemini、千问等主流模型;小米发布了380亿参数的具身数据生成模型Xiaomi-Robotics-U0,致力于解决真实训练数据难以获取的痛点。
“一脑多形”成新思路:行业不再迷信单一“人形”,开始根据任务需求选择不同形态(半人马、轮式等),核心逻辑是“大脑”通用、躯体适配。

三、商业化落地:时间表与理性预期
出货量快速爬升但基数仍小:IDC数据显示,2025年中国人形机器人出货量1.44万台,2026年预计超6.25万台,全年整机产量有望突破10万台。但大多仍停留在工业封闭场景,家庭消费级产品距大规模普及至少还需10年。
量产之难被放大:特斯拉Optimus被马斯克称为“史上最难量产产品”,量产时间从2026年夏季推迟至年底,首批只为内部数据采集。投资者警告,复制人类独特身体能力、无成熟供应链等障碍使商业化成功“需要漫长等待”。
