0.22B的inpainting模型,看着效果还行,很适合端侧使用
Moebius,用 0.22B 参数做出接近 10B 级模型的图像修复框架
Moebius 是华中科技大学 HUSTVL 和 VIVO AI Lab 做的轻量级 image inpainting / 图像修复框架,目标很直接:在对象移除、局部补全、人像修复这类明确任务上,不再依赖 FLUX.1-Fill-Dev 这种 10B 级通用大模型。
它的参数量只有 0.22B / 226M,不到 FLUX.1-Fill-Dev 11.9B 的 2%。项目页宣称,Moebius 在 Places2、CelebA-HQ、FFHQ 等自然场景和人像场景的 6 个 benchmark 上,质量达到甚至部分超过 FLUX.1-Fill-Dev、SD3.5 Large-Inpainting 这类大模型,同时总推理时间快 15×,单步延迟约 26.01ms。
方法上,它没有单纯把大模型裁小,而是重构了扩散模型 backbone。核心模块叫 Local-λ Mix Interaction / LλMI block,把 self-attention 和 cross-attention 里的空间上下文、全局语义先验压缩成固定尺寸的线性矩阵,绕开传统 attention 的二次复杂度。说白了,它试图保留“哪里该补、补成什么”的关键交互,但把计算结构做轻。
训练上,Moebius 用的是从 PixelHacker teacher 到 Moebius student 的 adaptive multi-granularity distillation。它不在 pixel space 做昂贵解码,而是在 latent space 里做多粒度对齐:中间特征、扩散轨迹、不同尺度监督一起上,再用梯度范数动态平衡 loss。这个设计是在解决一个很现实的问题:小模型如果只靠压缩,很容易失去语义推理和细节补全能力;蒸馏要帮它把大模型的判断力保留下来。
它真正有意思的地方是路线选择。现在很多图像工具默认往“更大、更通用、更贵”走,Moebius 反过来问:任务边界明确时,能不能用专科模型换回速度、成本和部署自由度?如果它的代码、权重和第三方实测能站住,这类模型对移动端、边缘设备、本地批量修图、商业对象移除工具都更有现实意义。
代码、训练/推理脚本和模型权重已经开放;仓库标的是 Apache-2.0,论文为 ECCV 2026,arXiv 编号 2606.19195。
🔗 链接:http://t.cn/AXSmp6AI
💻 代码:http://t.cn/AXSmp6Af
📄 论文:http://t.cn/AXSmp6AM
🤗 模型权重:http://t.cn/AXSmp6Ax
#HOW I AI# #ai生活指南# #AI艺术#
