“先来一段蝉鸣,然后吉他声切入。”
对于这样一段看似简单的文字指令,现有的音频大模型不仅“听不懂”(搞错顺序或数量),而且“出得慢”(生成10秒声音,往往需要等待几秒甚至十几秒)。
这成了AI音频从“玩具”走向专业工作流和实时交互的最大绊脚石。
为了解决这一行业痛点,Noiz AI联合香港科技大学、清华大学等机构,正式推出了支持Anything-to-Audio的极速音频生成大模型AudioX-Turbo。
AudioX-Turbo不仅仅是一个能处理多种模态输入的生成器,更是将矛头直指“极速推理”与“精准可控”两大难题。 http://t.cn/AXaSZkgX
