【LLM实现自回归搜索!MIT哈佛等提出「行动思维链」COAT,推理能力大提升】OpenAI o1发布后,为提升LLM的推理能力,研究者尝试了多种方法。比如用强大的教师模型进行知识蒸馏、采用蒙特卡洛树搜索(MCTS),以及基于奖励模型的引导搜索。
近日,来自MIT、新加坡科技设计大学、哈佛大学等机构的华人研究者探索了全新的方向:让LLM拥有自回归搜索能力。通过自我反思和探索新策略,提升LLM推理能力。
研究者引入了行动-思维链(COAT)机制,使LLM在解决问题时能够执行多种元动作,并提出了一种创新的两阶段训练框架:
小规模格式调优阶段:让LLM熟悉并掌握COAT推理格式。
大规模自我优化阶段:运用重启与探索(RAE)技术,通过RL进行优化。
通过这种方法,成功开发出Satori,在数学推理任务中,成绩优异。Satori具有以下核心特点:无需外部指导,即可自我反思与探索。
主要依靠自我改进(RL),实现了最先进的推理性能。展现出强大的迁移能力,可应用于数学以外的领域。
论文地址:http://t.cn/A61vgwxM
开源项目:http://t.cn/A61vgwxx
