最近有不少新开源的 TTS 项目,比如 LuxTTS 我也挺感兴趣的。LuxTTS 是一个主打高质量、快速生成的语音克隆模型。
主要特点包括:
语音克隆:SOTA 的语音克隆性能可与其大 10 倍的型号相当。
清晰度:清晰的 48kHz 语音生成,不同于大多数 TTS 型号仅限于 24kHz。
速度:单显卡速度可达 150 倍,CPU 速度也基本能达到实时。
效率:能容纳在 1GB 显存内,意味着可以运行在任何本地显卡里。
官方小贴士:
请至少使用3秒钟的音频文件进行语音克隆。
如果你听到金属声,可以尝试 return_smooth = True。
t_shift 较低,发音错误的可能性更低,但质量较差,反之亦然。
项目地址:http://t.cn/AXq24nTS
发布于 上海
