求学指南站
7-22 20:13来自 科技看点

DeepSeek如何通过集成创新降低训练成本?

一、架构创新:用更少参数实现更强性能

1. 混合专家模型(MoE)架构

DeepSeek采用MoE架构,将大模型分解为多个“专家”子模型,每次推理只激活其中一部分。 这种稀疏激活机制使得模型总参数虽大(如V3达671B),但实际计算量大幅降低,训练效率提升数倍。

2. 多头潜在注意力机制(MLA)

DeepSeek自研的MLA机制在保证模型表达能力的同时,显著减少了注意力计算的内存占用和计算量。 这一创新直接降低了训练过程中的显存需求,使同等硬件可训练更大模型。

3. 动态路由与降噪技术

通过动态路由降噪技术,模型能够更精准地筛选高质量训练数据,减少无效计算,进一步提升训练效率。

二、训练算法创新:以强化学习替代人工标注

1. GRPO算法:省去奖励模型

DeepSeek开发了GRPO(Group Relative Policy Optimization)算法,无需额外训练奖励模型,而是通过对比多个候选答案的相对优劣来驱动学习。 这不仅简化了训练流程,还大幅降低了强化学习阶段的算力消耗。

2. 纯强化学习冷启动

DeepSeek-R1-Zero完全依靠强化学习驱动推理能力生成,不依赖任何人工标注的思维链数据。 这种“从零开始”的方式避开了代价高昂的监督微调环节,将训练成本压缩至极致——R1-Zero在198小时H800 GPU上完成,成本仅约29.4万美元。

3. 规则奖励系统替代过程奖励

DeepSeek采用基于硬编码规则的奖励系统,而非学习型的奖励模型,避免了模型“钻空子”的风险,同时降低了训练复杂度。

三、工程优化:从底层榨干硬件效率

1. FP8混合精度训练

DeepSeek率先在训练中大规模应用FP8混合精度,效率约为传统BF16精度的1.6倍。 这直接缩短了训练时间,降低了GPU租用成本。

2. 直接使用PTX汇编指令

DeepSeek团队绕过CUDA高级API,直接使用更低层次的PTX指令来调用GPU硬件,从而在芯片层面实现更精细的算力调配。 这种极致的工程优化使有限算力的利用率达到极致。

3. 高效推理系统设计

DeepSeek公开了其推理系统的设计方案,通过EP(Expert Parallelism)等分布式策略,使推理服务的利润率可达545%, 说明其整个技术栈的成本控制能力已形成闭环。

四、数据与开源策略:降低研发门槛

1. 公开精确数据配方

DeepSeek在论文中详细披露了训练数据规模(如2.6万道数学题、1.7万条代码)及创建流程, 使全球开发者可复现其成果,避免了重复试错成本。

2. 开源模型与工具链

DeepSeek采用MIT许可证开源模型权重和代码, 允许任何人自由使用、修改和商用。这催生了社区层面的二次创新,如UC伯克利仅用30美元就复现了R1-Zero的强化学习流程。 开源还吸引了全球37%的贡献者帮助优化分布式训练框架,相当于免费获得了全球研发力量。

3. 知识蒸馏技术

DeepSeek将R1的推理能力蒸馏到32B、70B等小模型中,使小模型也能达到接近o1-mini的水平。 这种“大模型教小模型”的方式,让更多机构无需从头训练即可获得高效模型,进一步降低了全社会的AI应用成本。

五、成本数据实证:从百万级到千元级

DeepSeek的集成创新成果直接体现在公开成本数据上:

DeepSeek-V3完整训练成本约557.6万美元,仅为同等性能闭源模型的1/10至1/20。

DeepSeek-R1特定训练阶段仅29.4万美元,且基础模型成本也远低于行业平均水平。

API定价方面,DeepSeek-R1输出价格仅为OpenAI o1的3%,被业界称为“AI价格屠夫”。

2026年4月,DeepSeek进一步将API缓存输入价格降至首发价的十分之一,百万Tokens仅0.025元,创全球大模型价格新低。

六、开创AI发展新范式

DeepSeek的成功证明了“算法创新可以部分替代算力堆砌”的可行性。 这种集成创新模式不仅降低了训练成本,更开启了AI产业的新局面:

打破“规模至上”迷信:通过架构和算法优化,有限资源也能产出顶尖模型,为资源受限的研究机构开辟了道路。

推动开源生态繁荣:完整的开源策略使得全球开发者可在此基础上持续迭代,形成“技术众包”效应,加速了整个行业进步。

实现AI普惠:极低的推理成本让中小企业和个人开发者也能享受前沿AI能力,加速了AI在各行各业的应用落地。

DeepSeek用集成创新交出了一份“低成本、高性能”的答卷,正在重新定义AI发展的游戏规则。