#梁文锋署名新论文曝光#现在跑个大模型,对硬件的要求真是越来越高。就连KTransformers这种专门为MoE优化过的推理架构,也还是得把好几个Expert模型塞进显存里才能工作,负担不小。而Engram的思路不太一样,它干脆把存储和计算这两件事给分开了,算是一种更根本的解法。
接下来会不会发展出可插拔的Engram模块?虽然现在的论文里,Engram嵌入表还是和整个模型一起端到端训练的,但技术上完全可以设想一个中间抽象层,让这些知识模块变得能像U盘一样插拔替换。
发布于 四川
