
国内有哪些公司在做语音大模型?
国内语音大模型赛道已形成 车企自研(理想、问界、小米)、科技巨头底层赋能(阿里、百度、腾讯、字节) 和 专业语音厂商(科大讯飞) 三大阵营,2026年纷纷加速在车载场景的落地。
一、车企自研语音大模型
1. 理想、问界、小米
2024年底就有媒体对这三家车型的大模型进行了对比测试,聚焦交互体验、出行推荐、娱乐功能和信息问答等方面。
理想汽车在生态整合上表现出优势,其自研大模型深度融入车辆控制系统与用户日常交互。
问界和小米也分别将大模型作为智能座舱的核心交互入口,强调语音的自然感与低延迟。
2. 车载语音的核心要求
车载场景对延迟要求极高,阿里千问Qwen-Audio-3.0-TTS的Flash版延迟≤300ms,专门适配车载语音。
车企自研模型普遍采用端云结合方案,离线处理基础指令,在线调用云端大模型完成复杂任务。
二、科技巨头提供底层语音能力
1. 阿里巴巴
2026年7月推出Qwen-Audio-3.0-TTS双版本:Flash版用于车载/实时客服,Plus版用于有声书/数字人直播。
支持自然语言指令调节语速、情绪、口音,降低车企集成门槛。
2. 字节跳动、腾讯、百度
字节跳动(豆包)在四个月内完成了图-视频-音频全模态覆盖。
腾讯混元、百度文心语音模型均已开放API,支持多种方言与多语种识别。
这些大厂将语音能力作为“多模态门票”,为车企提供标准化解决方案。

3. MiniMax等新锐厂商
MiniMax以1/4价格拿下语音榜单双榜第一,推动车载语音成本大幅下降。
其语音模型采用共享思维底座架构,实现“边想边说”,提升交互自然度。
三、专业语音厂商:科大讯飞
科大讯飞深耕语音交互二十余年,积累海量通用口语、方言及专业话术语料,是中文语音方言语料龙头。
其星火大模型持续迭代,面向车载AI、智能硬件开放语音语料授权,是端侧语音大模型的核心数据供应商。
在政务、教育、医疗等垂直领域也有深厚积累,为车载多场景提供技术支撑。
四、其他参与者
1. 华为
华为盘古大模型主要聚焦商用领域(工业、医疗、自动驾驶等),并未重点押注通用语言大模型。
其在智能驾驶上提出原生基大模型,专为自动驾驶设计,与语音对话路线不同。
2. 中科创达、虹软科技
中科创达在车载AI智能座舱领域落地语音交互与自动驾驶感知算法。
虹软科技专注于3D视觉感知与车载视觉算法,间接提升语音与视觉融合体验。
五、行业趋势与规范
2026年语音能力已成为大模型公司的“奥运资格赛”门槛,投资人更看重多模态覆盖度。
国内语音AI已摆脱海外技术复刻,建成端云一体音频大模型生态。
语音模型落地需注意语料来源合规与内容安全,相关行业监管将趋严。