明风
25-07-20 12:55 微博认证:科技博主

这个报道在国内的关注度还是低了点,很多人可能还没意识到,这其实是AI发展进程里一个非常关键的里程碑事件。正如同文中的评论所说:这个成绩的意义甚至超越了「AI攻克IMO」本身。它不仅仅是一个模型的胜利,更是一个全新时代的开端!

补充几个细节:

1. IMO 2025刚刚结束(7月17日公开题目),没有时间针对这些题目做针对性训练。而OpenAI的这个模型,也是通用的推理模型,不是专门数学模型,另外很可能不是用CoT技术。

2. 没有工具(Tools),没有网络(Web Search),模型需要独立凭借对题目的理解,用自然语言写下完整的证明过程,不是只给答案。这应该是个大模型,而不是小模型。

3. 超长推理时间(小时级别):MO问题需要更高水平的持续创造性思维,在推理时间范围方面,现在已经一路攀升:GSM8K(顶级人类约需0.1分钟)→MATH基准(约1分钟)→AIME(约10分钟)→IMO(约100分钟)。

4. 新模型不是GPT-5,短期内应该不会被公布。GPT-5不是终点。但是巨大的草莓,代表它依然是推理模型,不过是超强的推理模型。

5. 研究的主要作者Alexander Wei是华裔,高中就到美国了,本科是哈佛大学,博士是伯克利。2015年IOI金牌。之前也在FAIR实习过,去年开始正式工作。其实Meta从来不缺人才,缺的是组织。嘲笑OpenAI很容易,理解OpenAI不容易。

另外,新智元的这篇报道,还给出了6道题目的细节,以及人工解题和AI解题思路对比,有兴趣的小伙伴可以仔细看看,体会一下。希望这个里程碑事件之后,苹果别再跳出来强调什么「大模型的推理能力是假象」了,毕竟再酸下去就真不体面了。

http://t.cn/A6kRrROe

发布于 浙江