
如何看待大模型在数学竞赛中的表现?
2026年7月21日,小红书大模型dots-note-3.0在第67届国际数学奥林匹克竞赛(IMO)中以42分满分成绩斩获金牌,成为中国首个获得IMO官方金牌认证的大模型,且满分率仅1%,超越此前谷歌Gemini模型5/6的纪录。
一、事件回顾:满分金牌的突破
2026年IMO于7月21日公布成绩,小红书大模型dots-note-3.0六道题全部答对,以满分42分获得“满分金牌”认证,超过金牌线13分。
这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后全球第二个达到该成绩的大模型,且是满分,谷歌当年只答对了5/6。
赛事涵盖代数、几何、数论和组合四个领域,每题7分,要求提交完整证明过程,组委会明令禁止任何人工干预。
二、数学竞赛为何成为大模型“试金石”
1. 客观性与严谨性
IMO考题均为证明题,对错一目了然,无法靠话术包装或主观评测蒙混过关。
数学证明讲究逻辑闭环,一步出错整个论证不成立,能六题全部严谨作答说明模型具备扎实的底层推理能力。
2. 难度与创新要求
IMO汇聚全球顶级奥数难题,考验创造性思维和举一反三能力,而非单纯机械计算。
行业内公认编程与数学是检验大模型真实能力的两大标尺,IMO更是其中的难度天花板。
三、大模型在IMO中的表现解读
1. 自然语言推理的创新路径
dots-note-3.0仅用自然语言就完成了从读题、解析到写证明的全过程,无需复杂公式前置处理。
在部分题目上还创新地提出了非常规解法,双CMO金牌得主刘涵祚评价其解法“结构紧凑、逻辑自然,属于较为简洁优雅的一类”。

2. 与海外模型的对比
谷歌Gemini模型在往年IMO中仅答对5/6,小红书大模型以满分实现超越,打破海外模型在顶级数学竞赛中的优势。
多个用户指出“国产大模型凭实打实的满分IMO成绩证明推理实力,超越此前海外头部模型的测评记录”。

3. 官方认证的含金量
IMO组委会严格按官方标准评卷,评分过程专业公正,满分成绩具有极高的说服力。
这是中国大模型首次获得IMO官方金牌认证,标志着国产AI底层技术迈上新台阶。
四、从竞赛到应用:大模型数学能力的意义
1. 技术能力的直接映射
数学推理能力是衡量大模型底层技术实力的硬指标,直接影响其在科研、代码生成、数理分析等场景的表现。
行业共识认为,能在IMO拿满分的模型,面对复杂问题时拆解任务、持续推进的能力必然强大。
2. 对教育与科研的潜在价值
大模型可辅助数学研究,提供新颖解题思路,甚至探索人类未发现的证明路径。
在教育领域,这类模型有望成为智能辅导工具,帮助学生理解抽象概念和逻辑推导过程。
3. 产业风向标作用
数学与代码是推广大模型底层技术的两个主要方向,IMO满分成绩直接提升了行业对国产AI能力的信心。
不少用户认为“国产大模型IMO满分夺金,预示未来在科研、数理研究场景,国产AI能够释放更大的价值”。
五、结语与展望
dots-note-3.0的满分成绩并非终点,官方已预告“更好的dots-note-3.0即将与大家见面”。
此次突破证明,国产大模型在深度推理领域已具备全球竞争力,未来在更复杂的数理任务、科学研究中或将持续创造惊喜。
随着技术迭代,大模型在数学竞赛中的表现有望从“解题”向“发现与创造”延伸,推动人工智能在数学基础研究中的应用边界不断拓宽。