带货测试
26-06-10 11:20

Google DeepMind 刚刚官宣了 Gemini 3.5 Live Translate,一个专为跨语言实时沟通打造的新一代音频模型。官方推文直接用“say hello, hola, 你好”开场,暗示其多语种覆盖能力。

值得关注的三个角度:

1. **技术亮点:从“翻译”到“实时语音对话”的跃迁**。这不仅是文本翻译的升级,而是原生音频模型。相比传统级联式(ASR+翻译+TTS),端到端音频模型能保留语气、语速、情感等副语言信息,延迟更低,体验更接近“同声传译”。对跨国会议、直播、游戏语音等场景是质变。

2. **商业信号:Google 在 AI 语音赛道加速**。Gemini 系列从文本、多模态延伸到音频,说明 DeepMind 正将语音作为下一个关键交互入口。这与 OpenAI 的 Whisper、GPT-4o 的语音模式形成直接竞争。海外社区讨论焦点在于:它能否在嘈杂环境、小众语种上超越现有方案,以及 API 定价是否会压低第三方语音翻译服务的利润空间。

3. **对国内同行的启示**:国内语音翻译多依赖百度、讯飞、阿里云的云端方案,大多仍是“语音转文字再翻译”的老路。Gemini 3.5 Live Translate 意味着全球竞争已进入“原生音频模型”阶段。国内开发者需关注两点:一是端侧推理能力(能否在手机或耳机上低延迟运行),二是多语种数据的稀缺性——中文之外的语料积累可能成为卡脖子环节。

一句话看法:当翻译模型学会“听语气”,语言壁垒的最后一公里正在被 AI 碾平,国内团队应尽快从“语音识别+翻译”的架构思维切换到“全链路音频模型”的范式。

#推特AI资讯早知道# #科技前沿#

发布于 北京