腾讯发布混元视频生成模型 HunyuanVideo,开源,130亿参数,可以生成较强物理准确性以及一致性镜头的视频。
- 统一图像与视频生成架构:HunyuanVideo 引入了 Transformer 设计,并采用全注意力机制实现图像与视频的统一生成。
- MLLM 文本编码器:一些早期的文本到视频模型通常使用预训练的 CLIP 和 T5-XXL 作为文本编码器,其中 CLIP 采用 Transformer 编码器,而 T5 则采用编码器-解码器结构。相比之下,HunyuanVideo 使用具有仅解码器结构的预训练多模态大语言模型(MLLM)作为文本编码器。
- 3D VAE:HunyuanVideo 采用 3D VAE 结合 CausalConv3D 技术,将像素空间的视频和图像压缩至紧凑的潜在空间。
- Prompt 重写:微调了 Hunyuan-Large 模型作为提示重写模型,以将原始用户 prompt 调整为模型偏好的 prompt 形式。
项目链接:http://t.cn/A6mJRROU
发布于 北京
