
小红书大模型如何在IMO中做到满分?
一、基础成绩:六题全对,满分通关
IMO 2026共六道试题,涵盖代数、几何、数论和组合四个领域,每题7分,满分42分。
dots-note-3.0在官方评卷中六题均获7分,超出金牌线13分,满分率仅1%。
此前谷歌Gemini模型在IMO中答对5/6题,未获满分;本次国产模型实现超越。

二、核心技术:智能体推理系统
模型构建了基于智能体的推理系统,用于独立完成数学证明。
答题过程中,系统从读题、解析到写出完整证明,全程使用自然语言完成,无需复杂公式前置处理。
这种无人工干预的自主推理方式,检验了模型对复杂问题的理解与拆解能力。
三、参赛流程:严格遵循官方标准
组委会在每个比赛日学生考试结束后才公布题目,模型须在规定期限内提交答卷。
测试期间严禁任何人工干预,包括调整解题步骤、补充逻辑、提示思路、修正答案或筛选结果。
提交后由IMO官方专业评卷团队审阅,确保评分公正权威。
四、解题亮点:创新解法与自然语言证明
部分题目中,模型不仅给出正确答案,还探索出非常规的创新解法,被冠军选手评价为“优雅”。
这种跳出固有解题框架的能力,表明模型不再局限于复刻人类知识,而是具备了独立探索未知问题的潜力。
与其他依赖网上现成解题模板的大模型不同,dots-note-3.0通过原生推理能力完成全部证明。
五、行业意义:验证深度推理能力
数学与编程被公认为检验大模型底层技术最直接的标尺,其评测结果难以通过语言包装或主观话术蒙混过关。
IMO试题均为全新命制的证明题,考验模型应对未知难题时的抽象思考、逻辑推理与论证严谨性。
满分成绩意味着小红书在基础模型能力上已达到值得行业认真审视的水平,也为国产大模型在数理研究、科研辅助等方向的落地提供了可信标杆。
六、后续展望:持续迭代升级
小红书官方表示“满分不是终点”,更好的dots-note-3.0即将与大家见面。
这一成绩既是对当前技术路线的有力佐证,也为后续模型在更多复杂推理场景中的应用打开了空间。