全速前进E
26-07-05 22:15

1/ 刚刚影视飓风又做了一次100小时重返荒岛直播,大家都看了吗,还是挺好玩的,最后结局也有很多意外,果然直播比录播还是更精彩一点

2/ 整个直播都是在野外,所以对实时字幕的要求其实很高,要给大家同步讲解

3/ 直播过程中会有很多干扰,比如说在树林里有很多各种各样的噪声,水声、风声、踩到树叶和干柴的声音等等,还有一部分画面是在水上,需要划船,有很多波浪和风的声音

4/ 另一个挑战是,直播中有时候会出现多人同时说话的情况,所以对模型的推理速度有很高要求,必须很快地把字幕生成出来。

5/ 这次直播算是实打实连着用了100个小时,用来生成字幕的模型是阿里的Fun-ASR-Realtime,在直播结束的致谢列表里,影视飓风特别把它列了出来。这个模型中间也贡献了一些高情商名场面。比如把woc,翻译成了What's up?

6/ 更强的版本Fun-ASR-Realtime模型这几天也上线了,这是一个端到端的语音识别模型,吐字延迟在零点一秒以内,在Artificial Intelligence的榜单上,这个模型的离线版本错误率在全球范围内是坠低的,同时也支持流式输出,已经在阿里的百炼平台上线了。而且这个模型的家族悠久,有开源模型,在GitHub上已经有1.9万星标

7/ 这是一个真正全球SOTA的开源模型,只有它把错误率降到了2%以下。影视飓风的直播不错,但里面一部分模型能力其实没体现出来,比如这个模型可以支持包括各种方言在内的五十多种语言,比如听懂最难懂的温州话,直播里其实也没有体现出来。

发布于 北京