科技产品记
9小时前来自 看点不推荐

梁文锋提到的MoE架构如何降低DeepSeek推理成本?

梁文锋在投资人会议上表示DeepSeek的廉价推理并非靠补贴,而是源自MoE(混合专家)架构、稀疏注意力与极致工程优化带来的结构性成本优势。

一、MoE架构的核心:按需激活,大幅降低计算量

MoE架构在推理时仅激活模型总参数中的极小部分,而不是像传统密集模型那样调用全部参数,这是成本下降的根本原因。

DeepSeek V4 Flash总参数量高达238B,但在实际推理中只激活少量“专家”子网络,激活参数量被压缩到极致,使得单次推理所需计算量远低于同参数量的密集模型。

传统模型“参数量越大成本越高”的规律被改写,MoE让模型可以做得很大,但推理成本却很低,形成了“暴力美学”式的效率提升。

二、稀疏注意力与KV Cache优化:从工程层面压榨显存

稀疏注意力机制配合MoE,进一步降低了长文本推理时对显存的消耗,只关注最相关的上下文部分,而非全量注意力计算。

V4版本缓存显存占用被压至前代的十分之一,这一技术细节是成本大幅下降的关键环节,让更大的模型可以在更少的硬件资源上运行。

工程团队对KV Cache做了深度优化,在推理时只保留必要的键值对缓存,避免冗余存储,从而以“工程换空间”,让庞然大物只占用极少的计算资源。

三、极致的集群调度与规模效应

当全行业大量调用DeepSeek时,服务商可以针对性地堆叠顶级算力集群,并跑满Batch Size,通过极高的并发量摊薄单次推理的固定成本。

大规模调度下,单位硬件在单位时间内能吐出的Token数越高,推理成本就越低,这正是DeepSeek敢于大幅降价的技术底气。

梁文锋直言,低价是模型架构持续优化的结果,而不是短期营销策略,计算效率高就能在有限算力下训练更大的模型,成本越低,越能承担更大的规模。

四、整体工程思维:从训练到推理的系统性降本

低成本是训练和推理全链路工程优化的结果,而非单一技术点的突破,这包括自研模型架构、极简运营模式(无客服团队、少量人员维护API)以及算力效率的极致追求。

MoE架构在推理时激活的参数极小,加上大规模集群的吞吐红利,让DeepSeek能以远低于竞争对手的价格提供服务,这直接改写了全球大模型的成本锚点。

梁文锋将这种“轻松”归结为技术效率的碾压:当别人在堆算力时,他们在压榨每一焦耳能量的利用率,从而实现了对算力紧缺环境的适应性突破。