这次DeepSeekV4.1的后训练算法基本没变。他们发现在当前阶段,对数据和环境流水线进行工程化改进所带来的边际收益,远远高于在后训练算法上追求创新所带来的收益。
技术报告里是这么说的:
“
在本次发布中,我们没有引入新的后训练算法。整体方案遵循标准范式:先进行监督微调(SFT),随后进行强化学习(RL)和同策略蒸馏(On-Policy Distillation,OPD;Gu et al., 2024;Lu and Lab, 2025),在算法层面并未做出超出成熟实践范围的修改。
相反,我们几乎将全部精力集中在模型训练所使用的内容,而非模型如何被优化上:我们投入建设大规模、自动化的数据合成与环境构建流水线。具体来说,这套流水线:
1. 合成多样化、可验证的训练任务,并同时生成相应的参考答案和奖励信号;
2. 以程序化方式构建并扩展交互式智能体环境,使得可以低成本地收集并评估模型的行为轨迹;
3. 通过严格的筛选、去重和难度校准,确保数据质量以及课程学习中的难度平衡。
我们发现,在采用固定且并无特别之处的优化流程时,系统性地提升合成数据与环境的规模、多样性和可验证性,几乎可以解释我们所观察到的全部性能提升。
这一观察也呼应了一个更普遍的经验:在当前阶段,对数据和环境流水线进行工程化改进所带来的边际收益,远远高于在后训练算法上追求创新所带来的收益。
”
发布于 山东
