火韦先生
26-05-21 22:51

RLVR 烧的那些卡,可能 85% 是在烧噪声。

今天刷到一篇挺颠覆的:作者发现 RLVR 训练里,权重的变化轨迹几乎是 rank-1 的——也就是说参数更新主要沿着一个方向走,而且这个方向上的幅度随步数近似线性增长。

🔍 那能干嘛?作者搞了个 RELEX:只跑前 50 步看一下方向,剩下的直接线性回归外推到 1000 步。Qwen2.5-Math-1.5B / Qwen3-4B / Qwen3-8B 上,15% 的步数就能追平甚至超过全量 RLVR,in-domain 和 OOD 都成立。

更离谱的是消融:把 rank 调高、换非线性模型,都没用。rank-1 + 线性,就是甜点。

💡 作者的解释是「去噪」——RLVR 本身的优化噪声很大,把更新投到 rank-1 子空间相当于把随机扰动滤掉了,反而走得更稳。

🤔 工程上看,这事跟之前一堆"RL 训练其实没学到新能力,只是放大 base model 已有分布"的观察是一脉相承的。如果后续在更大模型、更复杂任务(code、agent)上还成立,那现在大家拼 RL 算力的方式真得重想——不是不烧,是没必要那么烧。

留个保留意见:math 任务上 rank-1 太干净,换 multi-turn agent RL 大概率不会这么漂亮,期待有人去捅一下。 arXiv: 2605.21468

发布于 中国香港