大模型最大的问题是每生成1个token就要把整个大模型全算一遍。就好像查字典,不看目录,从头翻到尾,就算已经找到想找的内容,也要继续翻完,美其名曰不错过一个可能,但带来的巨大的浪费。
小激活参数的专家大模型相当于把一大本字典分成了好多分册,根据内容去找对应的分册就行。比如XXXX_35B_A3B。
还有靠猜的,用一个小模型预测正在查的token后面几个字,然后对应去找字典里可能的范围,这叫MTP。
也有记下已经算好的token,下次再查,不重复翻字典,直接给答案的ngram。
还有类似minimax视频大模型的并行计算,一次算完所有回复,举例就是800字命题作文,不再一个字一个字写,而是像一张模糊的照片逐渐变清晰,最后才能看到作文全貌,这样NPU/GPU的算力就不用受内存/显存带宽受限而摸鱼。
总之,对内存带宽的需求是大模型野蛮发展中被忽视的一环,现在已经被各种算法优化得到大幅降低,未来还将继续优化。而内存的容量,目前各家都在积极做的量化小模型,比如27B已经有了很好的效果,一些能力甚至超过了300B规模的大模型。
有人会说这是反向CWW的空头思维,但是单机内存需求减少带来成本的降低,也会提升全球的需求,一涨一跌之间实际上还是有广阔前景的,只是会没有那么暴利罢了。
$长鑫科技(SH688825)$
发布于 广东
