一直觉得 native sparse attention 那套路线有点重——为了省推理,先掏几百 B token 重新预训练,账其实不一定算得过来。
这篇《Full Attention Strikes Back》给的角度挺有意思:full-attention 模型本身就已经是稀疏的,只是没人把它「显化」出来而已。
三个观察我觉得是真有手感的👇
🔍 真正需要看长上下文的 head 是少数,剩下大部分 head 本地化就够了
🔍 长程检索基本活在一个低维子空间里,16 维的小 indexer 就能把相关 token 捞回来
🔍 每个 query 真正用得上的 token 数差异巨大,固定 top-k 不如动态 top-p
基于这三点搞了个叫 RTPurbo 的方案:只给 retrieval head 留全量 KV,其它走轻量 indexer + 稀疏注意力。
代价是几百步训练,换来 1M 上下文 prefill 9.36 倍、decode 2.01 倍,精度近乎无损。
我比较认这个 take 的原因是:跟 DeepSeek NSA、Kimi MoBA 那种 native sparse 预训练相比,这条路对中小团队太友好了——拿现成 full-attention 模型微调几百步就上车,不用赌「从头训一次」。
当然也有要打问号的地方:retrieval head 怎么选稳不稳、不同 base model 迁不迁得动、长 reasoning 链上 top-p 抖不抖,得有人复现一波才知道。但思路方向我赌是对的:稀疏不是训出来的,是挖出来的。 arXiv: 2605.16928
发布于 中国香港
