#小米发布具身领域首个统一生成模型#
小米今日发布并开源了 Xiaomi-Robotics-U0 多模态自回归具身生成基础模型:
Xiaomi-Robotics-U0 模型参数规模达 380 亿,是具身领域首个可同时覆盖四类核心任务的统一生成模型,打通了机器人图片与视频数据的生成、编辑全链路。
据官方介绍,该模型覆盖四大核心能力:
· 可根据文本描述为指定机器人生成多视角初始场景,覆盖桌面、厨房到复杂开放世界的各类环境;
· 支持将已有机器人轨迹迁移至新环境,调整光照、背景、物体材质等属性时完整保留机械臂位姿与场景布局;
· 能基于初始观测和操作指令生成机器人交互视频,兼顾动作连贯性与物理一致性,可零样本泛化到任意场景;
· 保留通用文生图与图像编辑能力,实现通用视觉知识向具身智能任务的迁移。
实际应用中,Xiaomi-Robotics-U0 既能在保障几何一致性的前提下完成数据增强,无需重新采集即可更换场景元素、添加干扰,也能从零生成危险、极端、长尾等真机难以触达的全新场景。搭配 FlashAR+推理加速方案后,其生成效率较原始自回归范式提升近 83 倍,大幅加快工程落地节奏。
性能表现上,该模型在 WorldArena 评测基准中取得总分第一名,全球共有 126 个模型参与参评;真机测试环节,在未知光照、陌生背景等分布外场景下,使用该模型扩增数据训练的策略任务,完成进度平均提升超 26%。
目前 Xiaomi-Robotics-U0 的相关代码与模型权重已全量开源,官方同步上线了项目主页与 GitHub 代码仓库,并在 Hugging Face、魔搭社区开放了模型权重获取渠道。
发布于 四川
