实验式Lab
26-04-22 01:06

刚睡醒刷了下, 月之暗面把 FlashKDA 算子开源了.

flash-linear-attention算子是什么?
大模型算长文本时,传统的注意力机制计算量是指数级爆炸的,所以大家搞出了“线性注意力”来降本。而 flash-linear-attention 就是目前开源圈子里跑这种模型最普及的“通用发动机”。
而Kimi 这次开源的,就是他们自己纯手工打磨的替换装"暴力发动机"。

直接看仓库:
1. 原生 CUDA 驱动. 核心算力 56.4% 是纯 CUDA 代码, 配合 CUTLASS 库把显存调用榨到极限.
2. 算力账本. 官方在 H20 特供卡上跑了基准, 预填充阶段速度比基线暴力拉升 1.72 到 2.22 倍.
3. 零迁移成本. MIT 协议, 即插即用的后端, 改行代码直接换引擎.

搞长文本推理的, 有卡自己拉下来跑跑看.

GitHub:
http://t.cn/AXxx1ywN

发布于 新加坡