火韦先生
26-05-14 21:31

做过视频生成蒸馏的人,大概都中过这个邪:4 步出图惊艳,8 步反而糊了,16 步直接崩。

按常识"步数越多质量越好"在 consistency distillation 上是不成立的——这不是 bug,是 CM 的设计就这样。

🔍 原因其实挺直白:consistency distillation 把原来的 probability-flow ODE 轨迹替换成了 consistency-sampling 轨迹。前者是连续光滑的,加步数自然 refine;后者是端点映射 z_t→z_0,多走几步就脱离训练分布,越走越歪。

所以 few-step 模型部署上线后,留给用户的"质量旋钮"其实是坏的——你以为多花点算力能换质量,结果换来一坨噪声。

NVIDIA 新出的 AnyFlow 思路挺正:把蒸馏目标从端点 z_t→z_0 改成 flow map z_t→z_r,学任意时间区间之间的转移。再配个 Flow Map Backward Simulation,把完整 Euler rollout 拆成 shortcut 转移,做 on-policy 蒸馏。

💡 实测在 1.3B 到 14B、双向和因果架构上都 work,少步打平 CM,多步还能继续涨。

我之前做短剧大模型那会儿,步数蒸馏这块最头疼的就是"测试时 scaling 性质丢了",业务侧总想留个 quality/latency 的滑条,CM 直接把这个滑条拧死。

flow map 这套范式(Align Your Flow、Shortcut Models、MeanFlow 都在这个方向上)今年大概率会成为视频蒸馏的新默认选项。CM 时代该翻篇了。 arXiv: 2605.13724

发布于 中国香港