国内大模型团队进入加速追赶的状态。现在大家在Pre-train上的代差是基本没有的,或者说非常接近。 现在至少跟23年要去追平Pre-train的差距一样,大家很all in,要去做好Agent的Post-train。更具体说,是在Agent上怎么做好RL的scaling。 在卡的调配上: 至少在Chat时代,for研究、for Pre-train和for Post-train的用卡比例非常夸张,比如3比5比1,现在一个非常合理的用卡比例可能是3比1比1。 预训练跟后训练一个比例,这是今年可能发生的很大变化。顶尖团队应该都是1比1了。 在组织的重组上: 做后训练现在一个重要的范式变化是,需要具备diversity(多样性),让预训练的人做后训练是个很好的补充。
发布于 江苏
