硅域寻常栈
18小时前来自 教育看点

小红书大模型IMO满分夺金,全程自然语言推理惊艳全球

一、事件核心:国产大模型首次拿下IMO官方满分金牌

7月21日,小红书官方发文宣布,其自研大模型dots-note-3.0在刚刚结束的2026年国际数学奥林匹克竞赛(IMO)上,以官方评卷42分的满分成绩获得“满分金牌”认证,超过金牌线13分。

本届IMO迎来了120多个国家地区约685名参赛学生,满分率仅为1%。 小红书的dots-note-3.0首次以官方身份正式参赛,考题涵盖代数、几何、数论和组合四个领域,每题7分,满分42分。

二、严格参赛规则:杜绝人为干预

针对模型参赛方,IMO组委会在每个比赛日的参赛学生考试结束后发放当日题目,并要求在规定期限内提交答卷。

测试期间严禁实施任何形式的人工干预,包括但不限于人为调整AI解题步骤、补充推理逻辑、提示思路、修正答案、筛选结果等。

收到题目后,dots-note-3.0模型基于智能体的推理系统完成了证明,提交由IMO组委会进行专业的评卷审阅,最终6道题均获7分。

三、技术亮点:纯自然语言推理与创新解法

dots-note-3.0的解题方式引人关注:它仅用自然语言就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了非常规解法。

双CMO金牌得主刘涵祚评价称:“模型最终给出了一条正确且漂亮的证明思路,这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。”

CMO金牌得主汪千桐也给出了相似结论:“从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。”

在他看来,dots解题简洁明了且直击本质,看完以后会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。

四、行业意义:数学与编程是AI的硬核试金石

行业内有共识认为,想要把大模型底层技术能力推广出去,一般是两个方向,一个是编程,另一个就是数学。

这两种任务的结果都很难靠语言包装蒙混过关,相比知识问答和主观评测,它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。

IMO作为全球最高水平的数学竞赛,每年吸引全球100多个国家和地区的最顶尖数学学子同台竞技,从中也走出了多位数学界最高荣誉“菲尔兹奖”的获得者。 即使高手如云,今年IMO的满分率也仅为1%。

五、网友热议:国产AI实力获广泛认可

消息公布后,多个相关话题登上热搜,如“中国大模型首次拿下IMO官方金牌”等,引发网友广泛讨论。

长期关注AI测评的网友指出,近两年来国产模型整体水平持续上涨,这次IMO满分又是一次重磅加分项。 不少网友表示,短短几年时间,国产大模型从勉强完成基础问答,进化到挑战国际顶尖数学竞赛,发展速度相当亮眼。

还有网友认为,IMO考题处处暗藏陷阱,十分考验模型临场推演能力,国产大模型顶住压力稳定发挥,实力相当抗打。 全程只用自然语言完成整套证明,不需要额外调试,原生逻辑能力如此之强,未来发展空间令人期待。

六、未来展望

官方表示:“满分不是终点。更好的dots-note-3.0,即将与大家见面,敬请期待。” IMO满分或许还远不是小红书大模型dots-note-3.0能力的上限。