
国产全模态模型WITA-Omni Preview如何赋能机器人?
一、核心突破:原生端到端架构打通机器人“感知-决策-表达”闭环
WITA-Omni Preview并非简单将聊天模型“装进”机器人,而是从底层重构了机器人的交互逻辑。

1. Thinker–Talker–Actor三模块协同
Thinker(思考):统一图文音视频表征,完成跨模态推理与交互决策。
Talker(说):依托思考模块状态,流式输出自然语音。
Actor(动):新增关键模块,将机器人动作、表情设为与语音同级的一级输出。
这套架构让机器人能够同步“看、听、判断、回应”,解决了传统多模块调度割裂的痛点,使得视觉、听觉、语言、肢体、表情实现全模态协同。
2. 登顶国际权威榜单印证能力
在DailyOmni评测中,WITA-Omni Preview综合得分85.21,超越Gemini 3.1 Pro Preview、Qwen3.5-Omni-Plus、Doubao Seed 2.0 Lite等国内外头部模型,八项细分指标六项第一。该榜单大量采用真实开放环境音视频素材,核心考核声画匹配、时序推理与跨模态语义理解,高度贴合人形机器人在物理空间交互的核心需求。

二、技术支撑:千万小时数据体系与三阶段训练策略
1. 数据底座
千万小时级多模态开源+自有数据。
自建以人为中心的高质量交互数据集,保留声、画面、语言、动作、表情的时序关联。
2. 三阶段训练
SFT监督微调:搭建全模态理解、多流生成与交互决策基础。
OPD同策略蒸馏:自师生蒸馏提升音视频时序推理能力。
RL强化学习(GRPO优化):围绕回答准确性、声画时间匹配、交互对象识别、回应时机等设奖励,让模型学会判断是否回应、何时回应、对谁回应。
三、赋能机器人的行业应用场景
1. “看听说动”一体化提升交互体验
WITA-Omni让机器人不再是只能执行指令的工具,而是能够感知环境、理解场景、把握情绪并自然回应的智能载体。机器人能同时识别画面和声音,梳理事件先后逻辑,自主判断回应时机和对象,实现流畅长时间的高质量对话。
2. 加速多元化场景落地
商业服务:零售导购、酒店接待等场景中,机器人可实时通过音视频判断顾客意图,主动提供帮助。
公共服务:政务大厅、展览馆中实现多模态指引与互动。
展演娱乐:配合肢体动作与表情,完成沉浸式表演与互动。
智元以WITA-Omni为交互智能底座,完善“交互、作业、运动”三智一体架构,驱动本体、数据、模型、场景四维技术飞轮迭代,持续拓展具身智能产业化边界。
四、行业意义:推动机器人从工具向伙伴进化
WITA-Omni Preview是行业首个机器人原生端到端多模态交互大模型,打破了传统分模块流水线模式,让机器人具备真实在场感与人格感,从单纯执行命令的工具转变为可深度交互的智能伙伴。这一突破将机器人赛道的竞争从硬件躯体转向智能大脑,标志着国产具身智能在全球人形机器人赛道迎来关键竞争窗口。