爱可可-爱生活
26-05-17 05:49 微博认证:AI博主 2025微博新锐新知博主

[CL]《Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling》Y Li, R Zhan, H Zhang, S Zhang… [Shanghai AI Laboratory] (2026)

在奥赛推理中,答对终点不等于证明成立。过去模型受困于单次生成和答案奖励,本质原因是缺少可持续的证明搜索、查错与修复机制。

本文的核心洞见是:把奥赛能力重新看作可分阶段放大的行为模式。由此,反困惑度SFT先塑造严谨长推理,再用答案级RL与证明级RL放大搜索和自修复。

这项工作真正留下的遗产是:小型MoE也能经训练与推理扩展逼近金牌线。它打开的新门是通用模型可被专门化为证明者,但门槛仍是奖励判别噪声与超长推理成本。

arxiv.org/abs/2605.13301 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京