量子位
26-06-15 15:07 微博认证:量子位官方微博

“先来一段蝉鸣,然后吉他声切入。”

对于这样一段看似简单的文字指令,现有的音频大模型不仅“听不懂”(搞错顺序或数量),而且“出得慢”(生成10秒声音,往往需要等待几秒甚至十几秒)。

这成了AI音频从“玩具”走向专业工作流和实时交互的最大绊脚石。

为了解决这一行业痛点,Noiz AI联合香港科技大学、清华大学等机构,正式推出了支持Anything-to-Audio的极速音频生成大模型AudioX-Turbo。

AudioX-Turbo不仅仅是一个能处理多种模态输入的生成器,更是将矛头直指“极速推理”与“精准可控”两大难题。 http://t.cn/AXaSZkgX