实验式Lab
26-04-30 08:04

千问开源一项FlashQLA算子库
Qwen开了个算子库FlashQLA, 一个基于 TileLang 写的线性注意力算子库

线性注意力跑长文本很爽, 但底层算力利用率极难优化. 这次更新是专门冲着在个人设备上跑 Agentic AI 去的.

▪️ 反直觉的算子拆分: 官方没有把 GDN 流程做全局融合, 而是硬拆成了俩算子. 这种做法在大 Batch 时会增加显存 I/O, 但在端侧设备跑长上下文时, 真实性能反而更强.
▪️ 极致的反向提速: 在片上内存极其吃紧的情况下, 硬手搓了一个 16 阶的 warp 专用流水线.
▪️ 最终跑分: 前向传播提速 2-3 倍, 最难啃的反向传播提速 2 倍以上.

FlashQLA本来就是专门给GDN系列设计的,但既然它挂了TileLang这层皮,其他线性注意力架构其实也能用。比起纠结到底能跑多快,不如说这事的意义在于——谁家的长上下文架构都绕不开这样的算子堆叠,要么厂商自己做,要么社区有人补,等生态自己长。

🔗 代码库:
github.com/QwenLM/FlashQLA
🔗 官方博客:
qwen.ai/blog?id=flashqla

发布于 四川