是宇不是宇XY
26-08-31 21:11 微博认证:超话主持人(财经类达人442超话)

大模型最大的问题是每生成1个to­k­en就要把整个大模型全算一遍。就好像查字典,不看目录,从头翻到尾,就算已经找到想找的内容,也要继续翻完,美其名曰不错过一个可能,但带来的巨大的浪费。

小激活参数的专家大模型相当于把一大本字典分成了好多分册,根据内容去找对应的分册就行。比如XX­XX_35B_A3B。

还有靠猜的,用一个小模型预测正在查的to­k­en后面几个字,然后对应去找字典里可能的范围,这叫MTP。

也有记下已经算好的to­k­en,下次再查,不重复翻字典,直接给答案的ng­r­am。

还有类似mi­n­i­m­ax视频大模型的并行计算,一次算完所有回复,举例就是800字命题作文,不再一个字一个字写,而是像一张模糊的照片逐渐变清晰,最后才能看到作文全貌,这样NPU/GPU的算力就不用受内存/显存带宽受限而摸鱼。

总之,对内存带宽的需求是大模型野蛮发展中被忽视的一环,现在已经被各种算法优化得到大幅降低,未来还将继续优化。而内存的容量,目前各家都在积极做的量化小模型,比如27B已经有了很好的效果,一些能力甚至超过了300B规模的大模型。

有人会说这是反向CWW的空头思维,但是单机内存需求减少带来成本的降低,也会提升全球的需求,一涨一跌之间实际上还是有广阔前景的,只是会没有那么暴利罢了。

$长鑫科技(SH688825)$

发布于 广东