GRPO 加温度调 diversity,调过的都懂这种痛:温度低 rollout 全长一个样,group 内 advantage 直接坍缩;温度一拉高,长链推理走两步就跑飞,逻辑断成段子。
今天榜上有篇 S2L-PO 挺有意思——干脆不在 token 层面抖了。
🤔 反直觉的发现是:同 family 里 pass@1 是大模型赢,但 k 一拉大,pass@k 反而是小模型超过去。也就是说 8B 给你的 N 条 rollout 其实都长得很像,倒是 1.7B 那帮"愣头青"思路杂得多。
📌 做法是把 1.7B 冻住当固定 explorer,给 8B 训练时供 rollout,再用 progressive annealing 慢慢切回大模型自采样,避免后期被小模型能力上限拖住。AIME 24 涨 8.8%,rollout 算力还省了。
💡 关键差别:小模型的 diversity 是 temporally correlated 的——一条轨迹"通顺地走错路",跟高温抖出来的 token-level 噪声完全是两码事。前者能给梯度估计提供结构化信号,后者基本就是 step-wise 干扰。
其实"base 模型在大 k 下反超 RL 之后的模型"这事,去年 Coverage Paradox 那波人就聊过了,只是没人正经把它当训练信号用起来。这篇算是把零星观察做成了 framework。 arXiv: 2605.30789
发布于 中国香港
