摇摆时间线ZHLMI
25-02-11 10:46 微博认证:上海慧龙计算机系统有限公司多媒体经理

关注 Pika 的用户应该知道它放出了一个新功能叫 Pika Addon,在不改变你原有视频的基础上,把你上传的图像做成 AI 结合在一起,比如@海辛Hyacinth 的这个:http://t.cn/A61h6OHl

而 DynVFX 这个项目也是用来做同样的事情,暂时还没开源,不过说是 Coming Soon,可以期待一下。

DynVFX 可以在原有视频的基础上,通过文本描述来添加新的动态 AI 元素,DynVFX 整合了一个视觉语言模型,将其视为“VFX 助手”,以解释用户的指令,推理与场景动态的交互,并为基于 T2V 的扩散模型提供描述性提示。

为了引导编辑的定位并使其具有内容感知能力,DynVFX 在从 T2V DiT 模型采样期间利用扩展注意力来选择仅与原始视频中作为锚点的特定位置相对应的键和值,从而使生成能够专注于集成的基本元素。

为了保证精确的像素级对齐,DynVFX 估计潜在中的残差,并将其添加到原始视频的潜在中。通过多次重复使用 AnchorExtAttn 的采样过程来迭代更新估计的残差潜在,逐步降低每一步添加的噪声水平,从图里可以看出来添加的元素是基于扩散模型的。

发布于 上海