斌叔OKmath
26-09-11 09:24 微博认证:橙旭园CEO 教育博主

这是一个值得注意的现象。DeepSeek 作为一个通常率先开发新颖算法和架构的实验室,现在却表示,在现阶段,提升数据质量的投资回报率远远超过了开发新颖的后训练算法。

我认为,对于非实验室从业者来说,这一点其实已经有一段时间是事实了。如果你正在进行 llm 后训练工作,你 80% 的精力都应该花在审视你的数据上。

这意味着:
- 聘请专家深入检查你的 RL 任务
- 手动筛选 rollout 和 sft 数据,移除可疑样本。确保所有任务实际上都是可通过的。
- 确保你的数据在难度和类别上都具有多样性。
引用:🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.

🔹 Introducing the smallest model in our new architecture family, with native visual understanding.
🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models.

1/6

http://t.cn/AX0kdENf

发布于 北京