杨骏驱
26-05-26 22:17

【何小鹏可能要多与供应链的老板喝酒,昨天刚给首批车主交付,今天继续催单】

小鹏GX纯电 Ultra旗舰版提车周期再增加一周,达到了29~33周,增程 Max和Ultra版本也从5-7周增加至6-8周,试驾继续排满,持续火热进行中;

今天不聊汽车,聊聊机器人,自2025年11月6日小鹏科技日后,小鹏机器人剪腿的场景,震惊世界成为第一个证明自己不是人类的机器人之后,过去半年时间,我们看看小鹏机器人取得的最新进展:

反复看了小鹏机器人联合高校发布了两篇非常高质量的机器人论文,可以看出小鹏在对机器人构建完整思考、意图、机器人世界内部的语言取得一定进展,构建机器人的自主思考,意识,判断仍有非常远的路要走,虽然远远没到我们平时在某些西方机器人公司发布的视频,能自主做家务,给人类帮忙等场景的实现,但是先思考再执行做的准,模仿人类,抗干扰能力取得一定的进展,了解小鹏目前机器人最前沿的研究和近况,论文链接如下:

DIAL:面向端到端具身智能体的基于潜在世界建模的意图与动作解耦方法
链接☞http://t.cn/AX6O2zD0 (单位:小鹏机器人 XPENG Robotics 、香港大学、北卡罗来纳大学教堂山分校,发布于2026年3月)
UniT: 迈向一种统一的物理语言,用于面向类人机器人的策略学习以及世界建模
链接☞http://t.cn/AX6O2zDp(单位:小鹏机器人 XPENG Robotics 、香港大学、清华大学,发布于2026年4月)

顾名思义,这是两套机器人理解物理世界的新架构 / 框架,并且各自定义了一套机器人内部的 “动作表示语言”,论文中演示的小鹏机器人是IRON-R01,两者分开解释:

DIAL的全称叫Intent and Action(解耦意图与动作),把机器人拆成大脑和小脑:
System-2(大脑):VLM 做隐式世界建模,
输入:语言指令 + 当前视觉
输出:未来场景的隐层特征(意图),不生成像素,只在 ViT 原生空间预测
意思就是负责想,用 VLM 做 “世界建模”,输出一个抽象的 “意图特征 / 潜在目标”(不是直接动作),在脑子里预想 “做完后场景会变成什么样”;

System-1(小脑):轻量逆动力学策略
输入:当前观测 + 大脑输出的隐意图
输出:机器人动作,必须靠弥合 “现在→未来” 的隐层差异来生成动作。
意思就是负责做,根据这个意图,再算关节伺服电机动作,照着大脑想的画面去执行动作;

很多智能机器人的 “大脑” 和 “手脚” 配合得并不默契。目前主流的智能机器人控制方式主要分两类,各有短板。

第一种是 “分步干活”:先靠语言视觉模型读懂你的指令、规划好步骤,再把计划传给负责运动的模块执行。这就像两个人传话,中间环节多、反应慢,而且前后两套系统没法同步优化,越复杂的任务,出错概率越高。

第二种是 “直接上手”:机器人看到画面、听懂指令后,立刻直接输出动作。这种方式反应快,但问题更明显 —— 机器人根本不会 “思考”,只是机械模仿动作,很容易投机取巧走 “捷径”。一旦场景里多了杂物、换了新物品,它就彻底 “懵圈”,完全没法正常工作。

而DIAL在实际测试中,这套技术的优势被展现得淋漓尽致。在模拟环境里,即便只用十分之一的训练数据,DIAL 机器人的任务完成率,也超过了传统模型用上全部数据的效果,相当于学习效率直接提升了十倍。

放到真实的人形机器人身上,表现同样亮眼。面对取物、倒水、物品传递、清扫杂物等日常任务,哪怕更换陌生的货架、桌面和物品,机器人不用重新专门学习,也能顺利完成操作。面对环境干扰、陌生物体,它的适应能力和稳定性也远超以往技术。

DIAL 跳出了过去老旧的控制思路,用 “思考 + 执行解耦” 的新架构,让机器人拥有了真正的自主规划能力,让机器人动作更聪明、更稳,听得懂、想得明白、做得精准 。

UniT 主要特点:给人和机器人造一套 “通用动作语言”,让人做一遍,机器人直接照抄,身体不一样也能学,机器人动作数据太少、太贵,人类动作没法直接用,UniT 把动作翻译成 “谁都懂的密码”,直接互通,不用给机器人录海量数据,海量人类视频直接能用,让机器人看了直接零样本学会,叠碗、倒水、抓取……人类会的,不用海量数据也变聪明,不用编程,不用训练,直接模仿;

数据省 10 倍:别人用 1000 条数据,UniT 只要 100 条
零样本学习:从没练过叠碗,看人类视频直接学会
抗干扰强:桌上乱、光线变、新场景都能干活
可扩展性强:还能不断扩容,网上随便什么视频都能拿来当教材,机器人越学越聪明,也不用为每一款机器人单独重新调试。以往积累的肢体配合、精细操作数据,也能持续扩充这套通用动作库;

发完这两篇论文,紧接着据《Humanoids Daily》记者报道,前往广州与北京参与小鹏 2026 年度 “AI 驱动行动” 媒体探访活动。在一场技术研讨会上,小鹏 AI 与机器人业务负责人米良川(LC)直面 IRON 人形机器人平台面临的挑战,给出了坦率的评估。尽管公司仍坚守 2026 年大规模量产的雄心目标,但米良川表示,团队目前正被机械工程领域难以攻克的现实问题所拖累。

报道链接☞http://t.cn/AXJNTddq
《小鹏机器人业务负责人承认硬件是“瓶颈”,2026年量产目标迫在眉睫》

总的来说就几点:
1.小鹏机器人负责人米亮川(LC)坦言,硬件可靠性目前是制约公司 AI 能力发挥的主要瓶颈;
2.小鹏正在广州建设一座 “数据工厂”,以解决物理 AI 规模化难题,具体训练数据类型仍属机密;
3.量产版 IRON 机器人将采用三图灵芯片架构,搭载与小鹏自动驾驶系统同源的VLA 2.0底层 AI 技术栈;
4.第一代灵巧手存在可靠性问题,小鹏正并行推进多条研发路线开发下一代灵巧硬件,暂未锁定单一方案;
5.小鹏认为当前人形机器人市场尚不构成激烈竞争,优先关注 “人机交互边界”,而非与特斯拉、波士顿动力等企业直接对抗;

从目前的信息来看,小鹏机器人虽然在软件有一定的进展(省数据高效率、强化学习、抗干扰、扩展泛化性),但是硬件可靠性仍然是需要继续攻克的难题,跟人相关的感知能力,比如关节的抓取力矩,触觉压力感知反馈,防水防污等问题仍需要一一攻克,机器人属于长期工程,需要有一定的耐心,相信11月小鹏科技日能看到最新的成果;

@小鹏机器人 #小鹏人形机器人##小鹏汽车[超话]#

发布于 广东