鹭羽 发自 凹非寺
量子位 | 公众号 QbitAI
哈?小红书你真是闷声干大事啊!
刚刚,IMO 2026成绩新鲜出炉,大模型交卷今年卷到了新高度。
结果第一个拿到官方评卷满分的居然是小红书???

经IMO官方评定,小红书大模型dots-note-3.0,六道题全部答对,以满分成绩斩获金牌。
含金量有多高呢?
这么说吧,这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后,全球第二个达到该成绩的大模型。
而且划重点!是满分!谷歌当年也只答对了5/6……
震惊了,这还是我印象中的小红书吗?
首次登上世界级竞赛,就来了场开门红~
再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮:
它仅用自然语言就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了非常规解法。
△图片由AI生成
双CMO金牌得主刘涵祚看完后这样评价:
模型最终给出了一条正确且漂亮的证明思路。
这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。
CMO金牌得主汪千桐也给出了相似的结论:
从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。
常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。
在他看来,dots解题简洁明了而且直击本质。
看完以后,会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。
换句话说,IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。
为什么当前的大模型需要IMO
先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。
IMO又叫国际数学奥林匹克竞赛,每年全世界最顶尖的中学生云集于此。
陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的,谷歌联创Sergey Brin也拿过IMO金牌。
比赛一般分两天进行,每天4.5小时需要完成3道题,总计6道题,覆盖代数、组合、几何和数论四个方向。每题7分,满分42分。
但光有答案还不算数,参赛者要想拿分,必须写出逻辑完整、能接受逐步审查的证明过程。
这对大模型来说,难度极高,却也是最直观的能力展示途径。
以Gemini为例,2024年谷歌首次挑战IMO,最终只拿到28分的银牌水平,彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言,部分题目耗时甚至长达数天。
第二年卷土重来,Gemini Deep Think直接以自然语言端到端完成证明,用4.5小时就解决了5道题,获得金牌。
这背后是一次跨代的能力跃迁。
往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。
再举个最近的例子,就在本周,Fable 5参与构造了一个雅可比猜想反例。
该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。
这次找到的反例虽尚未经过正式同行评审,但也标志着大模型现阶段的能力足以参与真正的数学发现。
而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。
除此之外,IMO还有一个相比Benchmark得天独厚的优势——未知。
每届比赛的赛题都是由专家命制,在正式比赛前严格保密。
也就是说,模型不可能提前拿到原题,实时参与当届比赛,也能够确保模型无法提前进行针对性训练。
一位头部模型研究员对此给出了这样的判断:
在今天的模型训练里,你基本可以认为,互联网上一旦出现了某些数据,很快就会被模型拿去训练,模型也就知道了。
所以如果要测试一个模型到底聪不聪明,只能测一些没有公开过的东西。
这恰是同步参与官方IMO测评之于大模型最难复制的价值。
它考验的不是模型记住了多少题目和数学知识,而是在一个真正未知的问题第一次出现时,模型能否独立理解、探索,并最终完成严密推理。
而且只有新题还不够,官方评测采用的是严格的当届赛事流程。
每个比赛日的学生考试结束后,模型团队才会收到当天题目,并须在规定期限内提交PDF答卷。
模型将直接阅读英文题目并生成证明,工作人员只负责保障系统运行。
最终答卷则由来自不同国家的IMO评审员,按照正式标准进行审阅。
本届新题、规定时间、完整证明、第三方专业评审,当这些条件同时成立,才让IMO成为现下很难靠背题和包装绕过去的能力大考。
一分没丢,比拿到金牌更难
正因如此,这次小红书大模型dots-note-3.0能拿到金牌,还是满分,就显得格外醒目。
六道题全部做对,首先证明的是Agentic推理系统稳定性。
模型需要读懂自然语言条件,判断哪些信息真正关键,提出可能成立的中间结论,再将它们组织成一套完整证明。
整个过程中,任何一个条件被误读、任何一次推导跳步,都会留下可以被评审直接指出的漏洞。
小红书大模型dots-note-3.0能够在六类不同问题中连续拿满,意味着它的表现并非依赖某一道题上的偶然灵感迸发。
其次,小红书大模型dots-note-3.0直接一步到位,使用自然语言端到端处理,也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径,具备从问题理解到答案表达的完整闭环。
它代表模型拥有可迁移的通用推理能力。
具体来说,在本次答题过程中,小红书大模型dots-note-3.0用智能体的方式,让模型使用自然语言结合python代码执行来推理解题。
在推理过程中,也会借助递归自我批判能力,审视自己的论证,从而解决更多现实中的复杂任务。
△图片由AI生成
不过,让人真正感到惊喜的,还是第三题传递出的模型创新思维。
这是一道组合博弈问题,网上关于本届IMO赛题讨论的常见解法,是先将原问题转化成图论中的连通性问题,再借助图论语言建立证明。
这条路线本身已经非常巧妙,但小红书大模型dots-note-3.0没有沿用它,而是转用归纳。
小红书大模型dots-note-3.0的解法,抓住了问题最本质的结构,设计出了恰到好处的归纳对象与归纳命题。
这也解释了,为什么CMO得主汪千桐会用漂亮和优雅来形容这套答案。
小红书大模型dots-note-3.0对问题结构的剖析之深,会让人自然而然产生一种恍然大悟的感觉。
回到结果本身上,模型能够在本届拿下满分,其实相当不易,我们可以从以下几个层面来看。
第一层,本届整套赛题的得分难度明显高于去年。
2026年IMO金牌线为29分,去年则高达35分,短短一年,金牌线下降了6分,几乎是一整道题的分数。
所以这一届的金牌,较之去年的Gemini,分量更重。
第二层,满分与金牌之间亦有差距,今年整整相差13分。
29分意味着,选手完整解决4道题,再从剩余两道题中拿到1分,就已经能够进入金牌区间。而小红书大模型dots-note-3.0全部all in,直接抵达了这套试卷能够衡量的最高点。
毕竟老话说得好,满分只是卷面的上限,不是它的上限。
金牌的确代表进入了全球最顶尖的一批,但满分则代表在这批顶尖选手中,再完成一次极小概率筛选。
小红书大模型dots-note-3.0即将开源
选择IMO作为起始站,也是小红书非常聪明的一步。
如今行业内,想要把大模型底层技术能力推广出去,一般是两个方向,一个是Coding,另一个就是数学。
原因也很简单,这两种任务的结果,都很难靠语言包装蒙混过关,相比知识问答和主观评测,它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。
IMO更是其中的佼佼者,知名度高、业内认可度也够,直接给到的是模型面对高难度未知问题时,所展现出的深度推理能力。
所以对小红书而言,这是一次重要的技术亮相。
过去,外界对小红书的技术认知,更多集中在内容社区、推荐算法和内容理解上。
在基础模型领域,小红书究竟处于什么位置,一直缺少一份足够公开权威,而且不需要复杂解释的成绩单。
参数规模很难直接等同于能力,常规Benchmark上的几个百分点,也难让行业形成鲜明认知。
IMO满分不一样,42分就摆在那里,足以证明,小红书已经具备值得行业认真审视的基础模型能力。
它用一枚IMO满分金牌,让行业第一次看清了自己的技术成色——
基础模型领域,出现了一个值得关注的新玩家。
P.S.对应模型即将开源~敬请期待
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟
科技前沿进展每日见











