attention 算力压了 28.4 倍,decoding 只快了 7.6 倍。
这个 gap 才是 MiniMax MSA 这篇里最值得品的地方。
🔍 背景一句话:长 context 大家都在卷 sparse attention。DeepSeek DSA·CSA 走 MLA 路线、在压缩维度里做块选择;MiniMax MSA 走 GQA 路线、在真实 KV 上做块选择。双分支:Index Branch 给每个 GQA 组打分选 Top-k,Main Branch 在选中的块上做精确 attention。
⚠️ 109B 模型 1M 上下文跑下来,per-token attention 算力降 28.4x,prefill wall-clock 提 14.2x,decoding 只剩 7.6x。
attention 早就不是长 context 推理的唯一瓶颈了。你把 attention 压到底,FFN、调度、KV 搬运、采样这些固定开销立刻顶出来。一个一个挤吧。
💡 还有个少被讨论的点:Index Branch 选块本身是个赌局。一个轻量 head 给全因果上下文打分,选错就直接丢历史——论文靠 KL loss 把 index 分布对齐到 Main Branch 上训。这种 learned router 在长尾 retrieval 任务上能不能扛住,得等社区实测。
📌 kernel 开源了但写死 SM100(B100·B200 那代),其他卡当前用不上。做推理优化的可以扒一下那段 CuTe-DSL,思路比代码值钱。 arXiv: 2606.13392
发布于 中国香港
