
小红书大模型如何做到IMO满分?
一、IMO的极高难度与满分含金量
IMO是全球最高水平的数学竞赛,每年吸引100多个国家和地区的顶尖数学学子参赛。今年共有约685名参赛学生,满分率仅为1%。IMO考题均为证明题,涵盖代数、几何、数论和组合四个领域,每题7分,特别考验答题者的抽象思考、逻辑推理能力和论证过程的严谨性。近年来,IMO已成为检验大模型推理能力的重要场景。
二、小红书大模型的技术突破点
1. 纯自然语言推理路径
dots-note-3.0不依赖复杂公式前置处理,仅用自然语言就完成了从读题、解析到写证明的全过程。最终答案全部正确,在部分题目上还创新地提出了非常规解法。


2. 独立智能体推理系统
收到题目后,模型基于智能体推理系统独立完成证明。测试期间严禁任何形式的人工干预,包括人为调整解题步骤、补充推理逻辑、提示思路、修正答案、筛选结果等。最终由IMO组委会进行专业评卷,六道题均获7分。
3. 创新解法获专业认可
CMO(中国数学奥林匹克)金牌得主刘涵祚评价:“模型最终给出了一条正确且漂亮的证明思路,结构紧凑、逻辑自然,即使放在IMO解答中也属于较为简洁优雅的一类。” 另一位CMO金牌得主汪千桐也认为,dots的解答“非常漂亮也很优雅”,直接攻克了题目最难、最本质的部分,人类选手很难想到能从该角度切入。
三、与海外模型的对比优势
此前谷歌Gemini模型在IMO中答对了5/6题,未能拿到满分。小红书dots-note-3.0成为全球首个在IMO官方评卷中获得满分的AI模型。这一成绩不仅体现了国产大模型在深度推理能力上的跨越式进步,也验证了纯自然语言路径在复杂数学问题求解中的可行性。
四、技术路线与行业意义
1. 数学与代码成为AI试金石
行业公认,数学和编程是检验大模型底层能力最硬核的标尺。相比知识问答和主观评测,数学证明的结果无法靠语言包装蒙混过关,直接考查模型能否真正理解复杂问题、拆解任务并持续推进。
2. 原创研发路线获验证
dots-note-3.0没有一味复刻海外研发思路,而是走出了独属于自己的推理逻辑。不依赖现成解题模板,依靠原生推理能力拿下满分,展现出国内AI原创研发的技术潜力。
3. 未来应用场景展望
IMO满分夺金意味着国产大模型在高难度数理研究、科研辅助、复杂问题拆解等领域具备了释放更大价值的能力。行业专家认为,这一成绩将载入国产AI发展历程,为后续技术突破树立了重要里程碑。