复旦 OpenMOSS 这波 MOSS-TTS Family 我觉得方向感是对的:不憋一个万能大模型,把语音任务拆成五个——主 TTS、对话 TTSD、声音设计 VoiceGenerator、音效 SoundEffect、实时流式 Realtime。
🔧 做过 AIGC 视频生成的都知道,TTS 这块最尴尬就是"一个模型干所有事":你让它念十分钟长文,它对话就拉胯;调好对话,角色音色又飘。拆开各练各的,工程上反而清爽。
几个我觉得真有手感的点:
📌 Nano 只有 100M,4 核 CPU 流式跑,48k 立体声——这是真的奔着端侧去的,不是发完 paper 就完事
📌 llama.cpp + ONNX 做 PyTorch-free 推理,GGUF 量化权重,8B 能塞 8G 显存——这套组合拳前段时间还只在 LLM 圈玩,搬到 TTS 是迟早的事
📌 SGLang 后端给 Delay 架构上了,吞吐 3x
要打问号的也有:
🤔 TTSD 说主观评测超 Doubao 和 Gemini 2.5-pro,自家评测要看怎么设的,长对话稳定性、跨语种码切、情绪连贯这些场景,等社区盲测出来再说
🤔 拆五个模型听着干净,落地时编排成本不低,谁负责切换、谁兜底、延迟怎么对齐——做过 ComfyUI 集群的应该懂这种 pipeline 的运维痛
但开源生态肯, 这种"拆开 + 端侧能跑 + 有 llama.cpp 路径"的姿态,比单纯刷榜的有用多了。 GitHub: OpenMOSS/MOSS-TTS
发布于 中国香港
