VibeVoice 是微软开源的一套前沿语音 AI 模型家族,涵盖长时语音识别与实时语音合成,单次即可处理长达 60 分钟的音频,输出带说话人、时间戳和内容的结构化转写。
不仅支持 50 多种语言的原生识别与 90 分钟多角色对话生成,还提供流式输入的实时合成,兼顾学术研究与实际部署需求。
GitHub:github.com/microsoft/VibeVoice
主要功能:
- 单次处理 60 分钟长音频,完整保留全局上下文与说话人一致性;
- 同时输出谁、何时、说了什么的结构化转写,支持自定义热词;
- 支持 4 角色、90 分钟长对话的自然多说话人语音合成;
- 0.5B 参数实时模型,首字延迟约 300 毫秒,适合流式场景;
- 提供 vLLM 加速推理与完整微调代码,开箱即可本地运行。
支持 Python 生态,通过 pip 一键安装,适合研究者、开发者与需要长音频处理的团队使用。
#开源项目# #语音AI#
发布于 北京
