在机器人行业里,智元是我除宇树外最关注的企业之一,不仅是智元机器人拥有像稚晖君这样知名的台前人物,同时智元幕后的华为班底也是很强的。
去年底,智元推出了 Agibot World 数据集,因当前机器人行业迫切缺乏高质量、大规模的训练数据,这套数据集在 GitHub 一周内便斩获 1200 多颗星。此外,智元自建了 2000 平米的数据采集工厂,数据工厂加上自研自产,这在初创机器人企业中是比较少见的。
今天,智元公布了首个通用具身基座大模型:智元启元大模型 Go-1(图1),想要完成从互联网数据、仿真数据、机器人训练数据到量产应用上的全流程闭环。(图2)
智元介绍了现在具身模型的困境:
1. 泛化性差,到新场景时成功率大幅下降;
2. 扩展新任务时需要大量数据,落地成本高;
3. 不同本体数据无法共用,数据成本高,就算是智元自己的几款不同的机器人本体数据也无法共用;
4. 模型无法持续进化。
就我目前走访的机器人公司来看,不少机器人公司训练单一动作往往需耗时数月,并且需要为客户的生产线进行高度定制化的训练。机器人公司不仅硬件标准不统一,数据格式不统一,而且每家机器人公司探索的应用场景也不同,即使在工厂产线上,不同行业(如汽车、家电、电子)的训练要求也截然不同,难以实现通用化。
智元介绍现有具身模型的局限主要体现在三个方面:
- DP/ACT 具身小模型:难以利用大规模图文和操作视频数据,技能单一、学习速度缓慢,且物体与场景的泛化能力有限;
- 基于 VLM 的大模型(如 VLA/RDT):未能充分利用跨本体和人类操作视频数据,难以构建通用的动作理解能力;
- 基于视频生成的模型(如 GR-1/2):难以通过 VLM 利用大规模图文数据,从而在场景感知、指令理解和语义泛化方面表现不足,小样本下对新场景或新任务的适应性较差。
为突破这些瓶颈,Go-1 基座大模型采用了 ViLLA 架构,借鉴了 DeepSeek 的专家模型思路,通过 VLM 与 MoE 的融合实现创新:
- Backbone:VLM;
- 专家 1 – Latent Action Expert(Latent Planner):利用互联网中丰富的人类操作及跨本体操作视频,赋予模型出色的动作理解能力;
- 专家2 – Action Expert(Action Predictor):借助高质量的仿真及真实机器人数据,实现动作的精细执行。(图6)
实验数据显示,在五种不同复杂度任务中,Go-1 的平均成功率较现有最优模型提升了 32%(由 46% 增至 78%);而单独验证 Latent Planner 时,其成功率也从 66% 提升至 78%,增幅达 12%。(图5)
我问了下智元团队,目前互联网上的工业场景数据少,同时工业场景对落地标准要求高,小样本泛化在工业场景是否适用。智元团队说目前还是需要深入到业务方现场采集数据,对于工业场景来说,高成功率往往需要几万甚至十万条数据的支撑。
对于这个行业来说,技术方向尚未明确收敛,加之数据获取难度大,使得进入工厂应用的机器人价格普遍在数十万元以上,投入成本极高。所以前阵子高盛给大家破了个冷水,对于人形机器人行业的发展要冷静一点。所以智元也提到了希望通过 Agibot World 数据集来推动数据格式的统一。看看高盛泼的冷水能不能被智元再泼回去。
另外补充一个信息,智元去年下线一千台机器人,今年计划量产数千台,属于近三年的机器人初创公司中第一批走入量产的公司,我们走访的其他机器人公司今年量产计划大概在几百台到一千台不等。 #稚晖君或再掀机器人行业风暴# #智元机器人发布首个具身基座大模型#
