i陆三金
24-12-03 15:17 微博认证:AI博主

腾讯发布混元视频生成模型 HunyuanVideo,开源,130亿参数,可以生成较强物理准确性以及一致性镜头的视频。

- 统一图像与视频生成架构:HunyuanVideo 引入了 Transformer 设计,并采用全注意力机制实现图像与视频的统一生成。

- MLLM 文本编码器:一些早期的文本到视频模型通常使用预训练的 CLIP 和 T5-XXL 作为文本编码器,其中 CLIP 采用 Transformer 编码器,而 T5 则采用编码器-解码器结构。相比之下,HunyuanVideo 使用具有仅解码器结构的预训练多模态大语言模型(MLLM)作为文本编码器。

- 3D VAE:HunyuanVideo 采用 3D VAE 结合 CausalConv3D 技术,将像素空间的视频和图像压缩至紧凑的潜在空间。

- Prompt 重写:微调了 Hunyuan-Large 模型作为提示重写模型,以将原始用户 prompt 调整为模型偏好的 prompt 形式。

项目链接:http://t.cn/A6mJRROU

发布于 北京