零重力瓦力
25-09-24 15:37 微博认证:AI博主

阿里终于介绍了最近特别火的绘画模型 qwen-image 和视频生成模型通义万相(Wan) 背后的功臣 paiFuser 技术。

为什么做视频这么难?视频生成确实比图片难很多。图片只有横竖两个方向,但视频还要加上“时间” 这一纬度,数据量一下就大了很多,电脑压力也更大。而且,视频生成不只用到一个模型,而是好几个模型一起合作,每个部分加速的方法又不一样。要让整个流程都变快,就得对每个环节都下功夫。

paiFuser 针对视频生成做了一系列的优化,比如:

1. 把大任务拆开,让不同的部分可以同时处理,互不影响。
2. 在多张显卡配合时,让 “等消息” 的时间也能用来算别的,节省时间。
3. 用更节省空间和更快的数值表达方式,既保证速度,也不影响画质。
4. 只对关键地方重点计算,不浪费资源。
5. 把常用的小步骤做成更高效的“零件”,减少不必要的浪费,并且还会复用中间结果,避免重复劳动。
6. 整个训练过程,对显存做了很多优化,让更高分辨率、更长的视频都能顺利训练出来。
7. 数据预处理和缓存做得很到位,减少无用功,让训练循环跑得更快。
8. 机器出问题还会自动检测和修复,保证训练不中断。

以上优化带来的提升很明显。比如说,生成一段高清视频的速度,能从原来的 564 秒缩短到 96 秒,提升了 8 倍多。训练视频的时间也大大缩短,就算大规模训练也能抗住压力。

paiFuser 对硬件要求也不高,常见的显卡也能用。对于需要高画质、又希望得到快速反馈的视频创作者,以及需要大规模训练和推理的企业,都能从中受益。

#ai技术##wan2.5##ai生活指南##ai创造营# http://t.cn/R4VULNo

发布于 浙江