新车动态汇
AI语音大模型交互最新进展:端到端与全双工成主线(截至2026年8月)
截至2026年8月,语音大模型交互正告别传统“ASR转文字—大模型—TTS合成”三段串联架构,端到端语音大模型(Speech-LLM)、全双工实时对话、语音Agent、轻量化端侧部署成为四大主线。交互从一问一答的回合制,进化为可打断、插话、倾听反馈、感知情绪的真人式对话。
一、核心技术突破
1. 端到端语音联合建模(摒弃中间转文字环节)
传统方案会丢失语气、停顿、情绪、音色等副语言信息;新一代模型直接接收音频信号输入,直接输出语音结果,减少信息损耗,降低链路延迟。
- 海外:Gemini 2.0 Speech、NVIDIA Nemotron3 VoiceChat,统一流式架构,音频进音频出,支持随时打断对话。
- 国内:清华SALMONN-2、阿里Qwen2-Audio、复旦MOSS-Speech,跳过独立ASR模块,同时完成语音理解、问答、情绪识别、笑声生成,部分模型已开源可部署。
2. 全双工实时交互(边听边说)
这是2026年交互最大革新:AI可以一边听用户说话,一边输出语音,支持插话、打断、停顿,输出“嗯、啊”这类倾听语气词,模拟真人对话节奏。模型每秒多次决策:继续听、开口说话、暂停、调用工具。
- OpenAI GPT-Live/GPT-Realtime-2:集成GPT-5.5推理能力,支持工具调用、联网搜索、实时翻译,上下文窗口提升至128K,解决思考时长时间沉默问题。
- 阶跃StepAudio2.5 Realtime:国产实时语音模型,强化副语言,支持大量自定义人设,在国际盲测榜单表现靠前。
3. 语音Agent:听懂同时执行任务
语音不再只是问答,AI从语音里感知情绪、语义,直接调用工具完成现实任务:预约、查资料、设置日程、多模态输出卡片;声音虚弱还可以识别身体状态,把语音交互升级为智能体入口。
4. 轻量化与端侧落地
出现15-30亿参数小尺寸端到端语音模型,不用依赖大算力云端,可在手机、智能硬件本地运行,降低延迟,保护隐私。代表:Liquid AI LFM2-Audio-1.5B,实现低资源设备实时语音对话。
二、国内外代表性产品/模型更新
海外
- OpenAI GPT-Live(7月发布):ChatGPT新一代语音交互,每周超1.5亿用户使用语音功能;全双工流式对话,支持打断、倾听语气词,可联网、调用工具、实时翻译,可输出图文卡片辅助语音对话。
- Google Gemini 2.0 Speech:原生语音输入输出,极低延迟,多模态联动,语音对话同时处理图片、文档信息。
- NVIDIA Nemotron3 VoiceChat:120B端到端语音基座,抢先体验,面向开发者做全双工对话应用开发。
国内
- 字节Seed Audio1.0(7月):端到端音频大模型,人声、环境音效、背景音统一建模,可直接生成完整影视级音频作品,不止单纯语音对话。
- 阿里Qwen2-Audio系列:支持语音问答、音频解析、音乐识别,TTS3.0实现高拟人语音输出,开源版本可供开发者二次开发。
- 腾讯混元HyASR3.0(8月):MoE架构,方言、噪音、耳语场景优化;普通话词错率2.62%,粤语等十余种方言识别增强,已经接入腾讯元宝助手与云API。
- 阶跃StepAudio2.5:TTS、ASR、Realtime实时对话全套,国际盲测榜单国产第一,擅长高拟人度人声生成,大量人设定制能力。
- 科大讯飞星火X2:支持130+语种,强化小语种、地方口音识别,面向硬件、翻译设备落地。
三、行业落地趋势
- 硬件底层化:语音能力成为操作系统底层基础设施,手机、车机、智能音箱不再只是简单语音助手,内置语音大模型,免提连续对话成为标配。
- 声音复刻与AI音色:几分钟录音就可以生成高度拟人的个人音色,广泛用于配音、陪伴,但同时带来声音伪造安全风险,行业开始增加水印检测机制。
- 方言与小语种普及:国产模型在东南亚、非洲小语种表现提升,语音AI出海加速,解决小语种识别短板。
- 开源生态爆发:大量端到端语音模型开源,开发者可低成本搭建私有语音对话系统,降低创业与二次开发门槛。
四、当前技术攻关重点
- 复杂长对话场景中,仍需解决幻觉以及长上下文下的情绪一致性稳定问题。
- 全双工模式算力消耗高,云端调用成本偏高;端侧轻量化模型综合能力仍弱于大参数量云端版本。
- 声音伪造、深度伪造音频鉴别,成为行业安全难题。