用多图输入作为参考素材生成视频的开源版模型来了😮~!
Skywork/SkyReels-A2・Hugging Face
🧐SkyReels-A2 模型利用视频扩散变换器的创新方法,通过编码参考图像的空间和语义特征,实现视频内容的高效生成。
➡️链接:http://t.cn/A6rVw8OY
✨重点
●🖼️ 该框架包含两个分支:空间特征分支使用精细化的 VAE 编码器处理图像,语义特征分支利用 CLIP 视觉编码器和 MLP 投影进行语义编码。
●🔗 空间特征与带噪声的视频标记沿通道维度进行连接,经过扩散变换器块处理,以生成视频。
●📊 语义特征通过额外的交叉注意力层被整合进扩散变换器中,以确保在扩散过程中有效地融入语义上下文。
●🎨 页面展示了一些生成结果,以展示模型的实际效果和应用潜力。
●📑 如果你在研究中使用 SkyReels-A2,可以引用提供的 BibTeX 格式的文献。
发布于 奥地利
