Simon的白日梦
25-12-30 12:38 微博认证:科技博主

一个能够根据故事情节自动设计分镜,并且保证角色连续性、一次性生成一分钟长视频的AI模型,基于wan2.2开发,看样片效果还不错🥹。
{StoryMem: Multi-shot Long Video Storytelling with Memory + StoryMem:基于显式记忆机制的多镜头长视频叙事生成}
🧐{南洋理工大学与字节跳动联合推出的一种模仿人类记忆机制的视频生成新范式,通过构建动态更新的显式视觉记忆库(Memory Bank),将现有的单镜头视频生成模型转化为能够创作分钟级、多镜头且人物场景高度一致的长视频叙事者。}
➡️链接:http://t.cn/AX4WiDAY
✨重点
●🧠 显式记忆驱动生成:StoryMem不依赖于隐式的长上下文窗口,而是采用独特的“记忆-视频”(Memory-to-Video, M2V)设计,维护一个包含历史生成画面关键帧的紧凑记忆库,确保长视频中的人物和场景在不同镜头间保持一致。
●💾 动态记忆更新策略:系统并非简单存储所有历史帧,而是通过“语义关键帧选择”和“美学偏好过滤”机制,只保留最具信息量和高质量的画面进入记忆库,有效防止了长序列生成中的质量衰退。
●🔌 低成本LoRA适配:该框架不需要对视频生成模型进行全量微调,仅通过LoRA(低秩适应)微调即可将记忆模块注入到现有的Video DiT(Diffusion Transformer)模型中,保留了原模型的高画质和遵循指令的能力。
●⚙️ 关键技术细节:在技术实现上,记忆帧经过3D VAE编码后,通过潜在空间拼接(Latent Concatenation)和负RoPE位移(Negative RoPE shifts)技术注入到当前生成过程中,无需复杂的重新训练。
●🎨 定制化故事生成:支持“基于参考的记忆”(Reference-to-Video),用户可以上传特定的角色或场景图片作为初始记忆,生成以特定人物为主角的定制化连贯故事(如“笨拙男人的故事”或“年轻恋人”)。
●📊 ST-Bench基准测试:为了更科学地评估多镜头叙事能力,团队提出了一个新的基准测试集ST-Bench,涵盖了多样化的叙事场景,实验证明StoryMem在跨镜头一致性上优于Wan2.2、StoryDiffusion等现有方法。
●📽️ 分钟级长视频能力:展示了生成林黛玉、圣诞老人等复杂叙事的能力,能够处理包含10个以上不同镜头的连续情节,打破了传统视频生成模型只能生成短暂、单一画面的限制

#AI白日梦想家[超话]# #ai创造营# #ai生活指南#

发布于 广西