[CV]《Exploring MLLM-Diffusion Information Transfer with MetaCanvas》H Lin, X Pan, Z Huang, J Hou... [Meta Superintelligence Labs] (2025)
在多模态大模型(MLLMs)与扩散模型结合的视觉生成领域,存在重要鸿沟:尽管多模态LLMs在理解复杂布局、属性和知识密集场景方面表现突出,但它们在生成图像和视频时,尤其是实现精准空间和时间控制方面仍显不足。本文提出MetaCanvas框架,通过引入“多维画布(canvas)令牌”与轻量级连接器,实现MLLMs在潜空间中直接进行空间-时序推理与规划,并将此规划信息分块注入扩散模型潜变量,从而填补理解与生成之间的差距。
MetaCanvas的核心创新在于:
1. 多维画布令牌设计:为图像采用2D空间令牌,对视频则使用稀疏关键帧3D令牌,动态插值后注入扩散潜空间,支持精细的空间布局和时序演化。
2. 轻量级连接器结构:包含Transformer模块与专用扩散Transformer(DiT)模块,确保画布信息与扩散潜变量高效融合,且训练初期通过零初始化避免干扰扩散模型输入。
3. 广泛任务适用性:覆盖文本到图像/视频生成、图像/视频编辑及上下文视频生成六大任务,支持三种扩散骨干网络,性能显著优于仅全球条件的基线。
实验中,MetaCanvas在GenEval文本到图像生成基准上收敛更快且效果更佳;在图像编辑任务中,提升了训练效率及编辑质量;在视频生成与编辑任务中,不仅保持原有视频质量,还极大增强编辑准确度和时空一致性,用户偏好度领先现有方法。此外,其在上下文视频生成中也表现竞争力,展示了强大的多模态理解与生成衔接能力。
该研究启示我们:将多模态大模型视为潜空间的规划者,而非简单的文本编码器,是提升视觉生成控制能力的一条有效路径。MetaCanvas以高效、模块化的设计,兼顾理解与生成优势,为未来多模态生成模型架构提供了新范式。
详细内容及实验数据请参阅:arxiv.org/abs/2512.11464
