车圈先锋
昨天 06:45来自 科技看点

国内有哪些公司在做语音大模型?

国内语音大模型赛道已形成 车企自研(理想、问界、小米)、科技巨头底层赋能(阿里、百度、腾讯、字节) 和 专业语音厂商(科大讯飞) 三大阵营,2026年纷纷加速在车载场景的落地。

一、车企自研语音大模型

1. 理想、问界、小米

2024年底就有媒体对这三家车型的大模型进行了对比测试,聚焦交互体验、出行推荐、娱乐功能和信息问答等方面。

理想汽车在生态整合上表现出优势,其自研大模型深度融入车辆控制系统与用户日常交互。

问界和小米也分别将大模型作为智能座舱的核心交互入口,强调语音的自然感与低延迟。

2. 车载语音的核心要求

车载场景对延迟要求极高,阿里千问Qwen-Audio-3.0-TTS的Flash版延迟≤300ms,专门适配车载语音。

车企自研模型普遍采用端云结合方案,离线处理基础指令,在线调用云端大模型完成复杂任务。

二、科技巨头提供底层语音能力

1. 阿里巴巴

2026年7月推出Qwen-Audio-3.0-TTS双版本:Flash版用于车载/实时客服,Plus版用于有声书/数字人直播。

支持自然语言指令调节语速、情绪、口音,降低车企集成门槛。

2. 字节跳动、腾讯、百度

字节跳动(豆包)在四个月内完成了图-视频-音频全模态覆盖。

腾讯混元、百度文心语音模型均已开放API,支持多种方言与多语种识别。

这些大厂将语音能力作为“多模态门票”,为车企提供标准化解决方案。

3. MiniMax等新锐厂商

MiniMax以1/4价格拿下语音榜单双榜第一,推动车载语音成本大幅下降。

其语音模型采用共享思维底座架构,实现“边想边说”,提升交互自然度。

三、专业语音厂商:科大讯飞

科大讯飞深耕语音交互二十余年,积累海量通用口语、方言及专业话术语料,是中文语音方言语料龙头。

其星火大模型持续迭代,面向车载AI、智能硬件开放语音语料授权,是端侧语音大模型的核心数据供应商。

在政务、教育、医疗等垂直领域也有深厚积累,为车载多场景提供技术支撑。

四、其他参与者

1. 华为

华为盘古大模型主要聚焦商用领域(工业、医疗、自动驾驶等),并未重点押注通用语言大模型。

其在智能驾驶上提出原生基大模型,专为自动驾驶设计,与语音对话路线不同。

2. 中科创达、虹软科技

中科创达在车载AI智能座舱领域落地语音交互与自动驾驶感知算法。

虹软科技专注于3D视觉感知与车载视觉算法,间接提升语音与视觉融合体验。

五、行业趋势与规范

2026年语音能力已成为大模型公司的“奥运资格赛”门槛,投资人更看重多模态覆盖度。

国内语音AI已摆脱海外技术复刻,建成端云一体音频大模型生态。

语音模型落地需注意语料来源合规与内容安全,相关行业监管将趋严。