科技深度前沿
7小时前来自 科技看点

梁文锋选择的稀疏激活架构和传统大模型有何不同?

一、核心决策差异:稀疏激活 vs 密集堆叠

设计哲学不同:传统大模型普遍遵循“Scaling Law”,通过无限制扩大参数规模、增加训练数据量和堆积算力来提升模型性能。而DeepSeek的梁文锋主动选择了稀疏激活架构,这并非简单增加参数总量,而是让模型在推理时只激活与当前任务相关的部分神经元,大幅提升计算效率。

难度层级不同:据廖恒评价,稀疏激活架构在收敛上“更复杂”,需要从顶层进行软硬件协同设计,属于战略级创新;而传统密集模型更依赖算力堆砌,工程实现相对简单。

二、行业共识的对立与抉择

主流路径的盲从:廖恒指出,当整个行业普遍“盲从Scaling Law”、盲目堆叠参数与算力时,梁文锋是少有的先行者,提前预判到单纯堆算力会遇到效率瓶颈。

破局者的价值:梁文锋的选择本质上是提前预判行业瓶颈后的主动破局。廖恒认为,这种不随大流、敢于挑战更难技术路线的决策,具有极高的行业价值。

三、对产业格局的实际影响

算力压力的缓解:稀疏激活架构通过“按需激活”机制,有效降低了大模型训练和推理的算力消耗,使得在有限芯片资源下也能训练出高性能模型。

软硬件协同的新方向:这一选择不仅是算法创新,更要求芯片(如华为昇腾)、框架与模型架构的深度适配。廖恒作为昇腾核心奠基人,对这种顶层软硬件协同创新的价值给予了高度肯定。