克雷西 一水 发自 凹非寺
量子位 | 公众号 QbitAI
6天,2000多万,小米这场史无前例的「炼丹直播」终于尘埃落定。
过去这六天,小米把一场大模型强化学习训练搬进直播间,眼看着美元计价器一路狂跳。
如今,MiMo-V2.6的Pro和Flash双双跑完30个训练Step,最终账单定格在350万美元(约合人民币2344万元)。

钱烧完了,模型也冲上去了。
MiMo-V2.6-Pro,1.02万亿参数,420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一。
Hugging Face CEO也称赞说,「太棒了」。

并且在多数Agent评测中,Pro的成绩已经逼近Claude Opus 5和GPT-5.6 Sol。

罗福莉将其称为「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」。
还没完,更猛的还在后面,这位曾参与DeepSeek-R1研发的小米MiMo负责人直言:
在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的DeepSeek-R1。
这话分量有多重?看完MiMo-V2.6的训练细节就知道了。
2000多万烧完,开源模型冲进闭源前沿
聊技术之前,先带大家快速过一下这次直播的「收官战报」。
MiMo-V2.6-Pro跑完30个Step,用时5天3小时,花掉约260万美元;
Flash同样跑完30个Step,用时3天10小时,花掉约90万美元。
每个Step包含1568个Prompt,每道题让模型尝试16条不同路线,一轮就会产生超过2.5万条Rollout。
按技术报告单步2.7B~3.7B training tokens计算,Pro全程累计处理约81B~111B Tokens,相当于塞满超过8万个百万Token上下文窗口。

这么多Token和真金白银砸下去,效果也相当直接。
30个Step结束后,Flash的平均通过率相对提升25%,Pro相对提升12%。
整体上涨之外,更有说服力的变化出现在DeepSWE v1.1这项样本外测试上。
Pro从58.4分涨到72.57分,提升约14分;
Flash从48.7分涨到65.68分,提升约17分。
DeepSWE v1.1专门考察Coding Agent能不能在真实开源代码库中持续工作,OpenAI和Anthropic也已将其列为前沿模型发布时的重点评测项。
MiMo-V2.6的表现侧面说明,这轮RL不是在训练集上原地刷分,只跑30个Step,模型不仅持续变强,还把能力迁移到了没见过的软件工程任务上,样本效率和样本外泛化一定程度上经住了检验。
尤其是Flash,30个Step跑完花费仅为Pro的约三分之一,相对提升反而更大,堪称这次训练的「性价比选手」。

至于Pro,负责的则是冲击能力上限。
在Artificial Analysis Intelligence Index中,MiMo-V2.6-Pro拿到46分,成功登上全球开源王座。

部分Agent评测中,它也已经和头部闭源模型打得有来有回。
例如AutomationBench上,Pro拿到53.1分,超过Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分。
再结合其他评测来看,MiMo-V2.6-Pro在全球模型市场中的位置已经相当清晰:
冲进开源模型第一梯队,并在部分Agent任务上摸到了闭源前沿。
而且能力冲上去之后,价格并没有跟着涨。
MiMo-V2.6继续沿用V2.5的API定价,Pro输入/输出每百万Token约3元/6元,Flash约1元/2元。
横向一比更夸张,在同等智能水平下,Pro完成任务的成本仅为国际前沿模型的1/20至1/60。
按照Artificial Analysis的测算,MiMo-V2.6-Pro完成一项Intelligence Index任务,平均成本只有0.13美元(约合人民币0.9元)。
也就是说,小米第一次把45分以上前沿模型的单任务成本,打进了0.1美元量级(约合人民币0.67元)。
巧的是,同日发布的闭源模型Grok 4.7,在这项指数上同样拿到46分,但据Artificial Analysis实测,其xHigh版本完成一项任务平均需要3.74美元,约为MiMo-V2.6-Pro的29倍。
同步上线的MiMo-V2.6-UltraSpeed模式,最高速度还能达到约900 TPS。
成绩单晒完,小米紧接着又把开源清单摊开了,一看阵仗还真不小。
Pro和Flash模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架,以及可以自由组合的mini-harnesses,全部开放。
此外还有一个MiMo-V2.6-Distill-Qwen-9B,这是一个以Qwen3.5-9B为底座,使用MiMo生成的77.4B Token数据完成监督微调的模型。
小米开放的是SFT版本,主要也是想给社区提供一个更强的Agent RL起点。
总之这一波,模型、训练场、裁判和训练流水线,小米基本都给配齐了。
也难怪小米一开源,整个AI圈瞬间沸腾。
罗福莉本人的推文在短短几小时内获得几十万浏览,不少大V也火速下场转发评论。

Ai2后训练负责人Nathan Lambert直接表示:
真正懂开源模型的人,早就知道小米在用MiMo憋大招。
他尤其点赞了「最高分开源模型+公开RL仪表盘」这个组合,直呼很有范儿。

Hugging Face前研究员Elie Bakouch关注的则是开源速度:
最夸张的是,他们在最终RL训练启动不到一周后,就交出了模型、技术报告、7000多个RL环境和完整训练框架。

AI研究者Himanshu Raj的评价更直接:
开源模型与闭源前沿之间的差距,又被大幅缩小了,而且这一次出手的还不是大家熟悉的中国玩家。

一片欢呼之外,有人迫不及待把视线进一步投向了「模型真正能做什么」。
超越Vibe Coding,MiMo直接Vibe World
模型刚训完,小米内部就把MiMo-V2.6-Pro扔进了一个极其刁钻的科研场景,让它设计新型MOF材料。
此前,MiMo-V2.6-Pro没有为科研场景做过一天的专项训练。
MOF,金属有机框架,2025年诺贝尔化学奖刚颁给了这个领域。通俗点说就是在分子尺度上搭建一种「多孔笼子」,可以精确地抓住特定的分子。
小米前沿材料团队用它来对付PFAS,这是一类全氟取代的有机物,PFAS进了水和土壤之后几乎不降解,被称为「永久性污染物」。

△PFOA(全氟辛酸,一种典型的PFAS类物质)结构示意图
拿MOF去抓PFAS,是材料科学领域一个公认的前沿难题。
MiMo-V2.6-Pro接到这个课题之后,先检索梳理了相关文献和专利,提出设计假设,然后自己核查方案的新颖性。
「大胆猜想」之后,MiMo便开始「小心求证」,它自动搭建好了模拟环境,并调用开源计算工具,计算它设计出来的MOF跟PFAS之间的结合强度。
它的思路是,在MOF内壁引入带正电的基团来吸引PFAS带负电的「头部」,同时嫁接更大、更扁平的芳香基团来容纳PFAS的含氟「尾巴」。
最终,模型跑出了两个候选结构,A50用的是芘基连接件,B50用的是三氟甲基联苯连接件,都是UiO-67型锆基框架。
模拟结果显示,A50和B50对PFAS的吸附性能是对照材料C50(联苯连接件)的一百万到一千万倍。

对此,北京大学材料科学与工程学院特聘研究员窦金虎教授评价说,MiMo-V2.6-Pro在这个项目上的表现,相当于一个训练有素的博士研究员。
小米方面披露,该系列已应用于公司内部新材料研发工作,整个研发周期从一个月压缩到了2到3天,效率提升十倍。
科研只是一个切面。
MiMo-V2.6这一代的能力,已经从「Vibe Coding」扩展到了「Vibe World」。
MiMo模型的能力边界,从写代码延伸到了更多场景,例如Blender 3D建模、视频创作、音乐生成,涉及各种不同的模态。
这也使得MiMo成为了开源Pro级模型当中鲜有的支持全模态的模型。
为了全面展示这些能力,小米团队用MiMo搭建了一个MiMo展览馆,里面的图像、视频、声音、3D模型等各种元素,全都是用MiMo生成的。

进入这座展览馆,映入眼帘的是一架钢琴,点击之后,钢琴就会开始自动演奏,演奏的音乐也是由MiMo创作,并且琴键也会匹配声音节奏进行运动。










