AI破壁仁er
26-03-26 17:18 微博认证:AI博主

看看这条有 Markdown 格式吗[吃瓜]

谷歌刚发的新技术 TurboQuant 算法,好像把美光和西部数据的股价吓崩了[笑cry]。

大模型推理,现在动辄吞吐几百万字,这里面有个致命的“内存刺客”叫 KV Cache。

简单来说,AI 本质上是个金鱼,记忆只有7秒(bushi)。为了连贯对话,它得把前面算过的数据存进高速显存里,当“小抄”。文本越长,这本小抄越厚。

换句话说,你以为卡住AI成本的是算力?其实是 **显存** 。

以前行业的解法很粗暴:买更大的显存,堆更多的硬件。或者强行做量化压缩,但代价是机器直接变傻,前言不搭后语。

但谷歌这次拿出的 TurboQuant 算法,玩的是降维打击。

它把极其吃内存的 KV 缓存压缩到了 3-bit ,内存占用直接暴降6倍。

最离谱的是,在检验AI记忆力的“大海捞针”测试里,它实现了 **零精度损失** 。

计算成本低了,不仅没变笨,计算速度还飙升了。在H100显卡上,注意力机制的速度最高暴涨了8倍。

这简直是美剧《硅谷》里的“无损极限压缩算法”在现实里成真了。[笑哭]

过去一年内存价格暴涨,本质上就是因为AI推理对内存的需求就像个无底洞。

现在好了,被釜底抽薪了。

这套算法不需要重新训练模型,“即插即用”。没准啊,以后的普通显卡、低内存的 Macmini、甚至是手机,都能部署一些规模更大的本地模型了。

**算力不够,数学来凑。** [doge]

#how i ai##ai#

发布于 北京