看看这条有 Markdown 格式吗[吃瓜]
谷歌刚发的新技术 TurboQuant 算法,好像把美光和西部数据的股价吓崩了[笑cry]。
大模型推理,现在动辄吞吐几百万字,这里面有个致命的“内存刺客”叫 KV Cache。
简单来说,AI 本质上是个金鱼,记忆只有7秒(bushi)。为了连贯对话,它得把前面算过的数据存进高速显存里,当“小抄”。文本越长,这本小抄越厚。
换句话说,你以为卡住AI成本的是算力?其实是 **显存** 。
以前行业的解法很粗暴:买更大的显存,堆更多的硬件。或者强行做量化压缩,但代价是机器直接变傻,前言不搭后语。
但谷歌这次拿出的 TurboQuant 算法,玩的是降维打击。
它把极其吃内存的 KV 缓存压缩到了 3-bit ,内存占用直接暴降6倍。
最离谱的是,在检验AI记忆力的“大海捞针”测试里,它实现了 **零精度损失** 。
计算成本低了,不仅没变笨,计算速度还飙升了。在H100显卡上,注意力机制的速度最高暴涨了8倍。
这简直是美剧《硅谷》里的“无损极限压缩算法”在现实里成真了。[笑哭]
过去一年内存价格暴涨,本质上就是因为AI推理对内存的需求就像个无底洞。
现在好了,被釜底抽薪了。
这套算法不需要重新训练模型,“即插即用”。没准啊,以后的普通显卡、低内存的 Macmini、甚至是手机,都能部署一些规模更大的本地模型了。
**算力不够,数学来凑。** [doge]
#how i ai##ai#
发布于 北京
