粮厂研究员Will
26-09-23 22:55 微博认证:投资内容创作者

Mimo 2.6刚刚发布完,罗福利就公布了v3的新进展:

MiMo-V3 正在采用全新架构。其核心技术 HySparse2 于今天正式发布。

预填充更少、KV 缓存更小、长文本检索更强——三者同时实现。

与 MiMo-V2.6 的混合滑动窗口注意力(Hybrid SWA)架构相比:

• 在 1M(100万)Token 长度下,预填充计算量(FLOPs)降低 5.02 倍

• 在 1M Token 长度下,KV 缓存缩小 4.5 倍

• 具有更高的 MRCRv2 和 RULER-v2 评分,同时 AgentPPL 和 LongPPL 更低

为什么要构建新架构?

智能体(Agentic)推理是一种截然不同的工作负载。在每一轮交互中,一个简短的动作可能会返回需要进行预填充的长文本观察结果,同时上下文还在不断增长。这使得预填充成本、KV 缓存大小和检索准确率同时处于关键路径上。

HySparse2 通过两级 KV 共享机制同时解决了这三个问题:

• KV 桥接(KV Bridging):借鉴 YOCO 的思路,交叉解码器(cross-decoder)中的全注意力层利用自解码器(self-decoder)的隐藏状态构建其 K/V。

• KV 复用(KV Reuse):在每个混合块内部,稀疏层会复用前一个全注意力层的 KV 缓存和选择索引。

另外还有两项改进:采用 Token 级别的选择来替代块(block)级别的选择,并用近期 Token 的强制窗口来替代独立的 SWA 分支,从而让本地和全局 Token 共享同一个 KV 缓存。由于所有的交叉解码器 KV 缓存现在都来自自解码器,因此预填充在自解码器完成时即可停止。

#小米科技[超话]#

发布于 中国香港