最近清华、复旦等团队在《IEEE CIRCUITS AND SYSTEMS MAGAZINE》发表的这篇论文,为具身智能提供了新的思路
【定义】
具身 AI 是实现 AGI 的核心范式,区别于仅处理数字世界抽象问题的 “非具身 AI”,其核心是与物理世界动态交互, intelligence 源于 “感知 - 认知 - 交互” 的闭环耦合(认知科学与神经科学基础)
目前具身 AI 的两大核心驱动技术:LLM&MLLM/WM
1.LLM/MLLM 驱动:赋能语义推理与任务分解
-LLM的核心功能
LLM通过语义推理(解析自然语言指令的语境与隐含知识)和任务分解(将复杂目标拆分为子任务序列),连接高层指令与低层动作。
局限:仅覆盖 “具身认知” 环节,依赖固定动作库与特定环境,难以适应新机器人 / 场景的自适应扩展。
LLM的局限性让研究者衍生出了MLLM(多模态大语言模型)
核心改进:扩展至全具身系统,通过跨模态理解(视觉 + 语言 + 触觉)实现端到端应用。
局限:缺乏物理规律约束(如忽略摩擦力导致抓取失败)、实时环境适应能力弱(静态预训练知识无法应对动态变化)。
2. WM (世界模型)驱动:赋能物理合规的环境交互
-WM 的核心功能
WM 通过构建外部世界的内部表征与未来预测,确保具身交互符合物理规律:
局限:缺乏高层语义推理(无法理解开放域指令)、通用任务分解能力弱(需依赖显式先验,如训练 “刚性物体操作” 后无法适配柔性材料)
【研究核心贡献】
提出了 “ MLLM-WM 联合驱动架构 ”
核心一:
MLLM 与 WM 存在天然互补性:MLLM 擅长语义推理但忽略物理约束,WM 擅长物理模拟但缺乏语义;联合架构可 “桥接语义智能与物理交互”
核心二:
联合驱动架构有着更低的时延,更强的泛化,可以进行语义抽象+物理对齐
不足:
MLLM 高延迟与 WM 实时表征的同步问题、语义 - 物理对齐偏差(如 MLLM 计划违反未建模物理规则)、大规模内存管理(WM 状态更新过载 MLLM)。
【总结】
MLLM-WM 联合架构是突破当前局限的核心路径 ——MLLM 提供语义推理能力,WM 保障物理交互合规性,二者协同实现 “复杂物理世界的通用具身智能”。为具身 AI 向 AGI 演进提供关键参考。
#微博新知#
