先说结论

2026 年 9 月 22 日,小米发布并开源了 MiMo-V2.6 系列。三个要点:

  • Pro 是当前最强开源模型。1.02 万亿总参数、420 亿激活,在第三方评测机构 Artificial Analysis 的智能指数上拿到 46 分,跟三天内发布的 Grok 4.7 打平,超过 Kimi K3 和 Qwen3.8 Max。
  • Flash 才是大多数人该用的那个。3090 亿总参数、150 亿激活,API 价格只有 Pro 的三分之一,但在小米自己的 Agent 跑分表上,多数项目跟 Pro 只差 1 到 4 分。
  • 价格是它最锋利的武器。Pro 每百万 token 输入 0.435 美元、输出 0.87 美元,Flash 是 0.14 和 0.28。同一档能力里,这是海外模型价格的几分之一。

但也有两条冷水:官方跑分表里编程类和渗透测试类仍然是明显短板;除 Artificial Analysis 那个 46 分之外,本文所有 Agent 分数都是小米自测,没有第三方复现。

一、这次发布了什么

一句话:两款开源权重模型 + 一个托管加速模式 + 一个小尺寸蒸馏模型,外加配套的 RL 训练环境和代码。

型号定位架构上下文权重
MiMo-V2.6-Pro旗舰1.02T 总参 / 42B 激活 稀疏 MoE1MMIT,开放下载
MiMo-V2.6-Flash高性价比主力309B 总参 / 15B 激活 稀疏 MoE1MMIT,开放下载
MiMo-V2.6-Pro-UltraSpeed托管加速模式与 Pro 同权重,推理侧加速1M不开权重,仅 API
MiMo-V2.6-Distill-Qwen-9B蒸馏小模型基于 Qwen 的 9B 蒸馏MIT,开放下载

几个值得单独说的点:

  • 全模态是原生的,不是外挂一个视觉塔:文本、图像、视频、音频都能直接吃。视频理解和音频理解在同一个模型里,不是几个专用模型拼起来的。
  • 1M 上下文对两个主力型号是标配,不分档位。按 VentureBeat 的报道,最长输出 128K tokens。
  • API 价格与上一代 V2.5 完全一致。小米的说法是"同一价格,更高智能",也就是说这次升级对老用户是免费的。
  • 模型名全小写:调 API 时用 mimo-v2.6-promimo-v2.6-flashmimo-v2.6-pro-ultraspeed

二、架构:一个稀疏 MoE,加一层被"冻结"的路由

两款主力都是稀疏混合专家(MoE)架构,但尺寸差得很多。以下是官方 model card 里的架构表:

项目MiMo-V2.6-ProMiMo-V2.6-Flash
总参 / 激活参数1.02T / 42B309B / 15B
层数(总 / 滑动窗口 / 全局)70 / 60 / 1048 / 39 / 9
隐藏维度61444096
路由专家(总数 / 激活)384 / 8256 / 8
滑动窗口大小128128
最大上下文1M1M
投机解码5 层 MTP5 层 MTP

两个模型共享同一套多模态编码器:681M 参数的 MiMo ViT 视觉编码器(28 层,24 层滑动窗口 + 4 层全局注意力)、308M 的音频 tokenizer127M 的音频 patch 编码器

架构上有三个细节值得记:

  1. 第一个 Transformer block 用全局注意力加稠密 FFN,往后才开始路由。这是为了让初始 token 表示先稳定下来,再交给专家网络——稀疏模型训练不稳的常见解法。
  2. 混合注意力:大部分层是滑动窗口注意力(窗口只有 128),少数层做全局注意力。Pro 是 60:10,Flash 是 39:9。这是把 1M 上下文做到可负担的关键——如果全用全局注意力,长上下文的计算量会直接爆掉。
  3. 5 层 MTP(多 token 预测)投机解码器:推理时一次猜多个 token,再批量验证。这是它跑得快的原因之一。

至于 UltraSpeed(超速模式),原理是三层叠加:FP4 无损量化 把权重压到 4 位、DFlash 并行解码 让草稿模型一次填满一整个 block、以及 TileRT 在系统层做 kernel 持久化和计算-传输重叠。官方口径是最多 20 倍输出速度,同样的质量。

三、训练:六天、75 万条轨迹、347 万美元

这次发布里最反常识的数字不是跑分,是训练成本。

小米给这次 RL 训练起了个名字叫 You Only RL Once——不再按任务类型分别训练,而是把编程、通用 Agent、视觉操作、网络安全四类任务混进同一个强化学习批次里一起训。

关键数字按官方公告整理:

  • 两个模型各完成 30 个 RL step,累计约 75 万条轨迹
  • 每个 step 用 1568 个 prompt,每个 prompt 生成 16 条 rollout,约 2.5 万条轨迹
  • 每个 step 消耗 35 亿到 37 亿 tokens,平均序列长度 11 万到 15 万 tokens
  • 全部完成用了 不到 6 天
  • 训练成本:Flash 约 85.4 万美元,Pro 约 262 万美元(合计约 347 万美元)
  • 自动评分占了算力的一部分:Pro 的开销里约 43.8% 是 rollout 生成、43.5% 是参数更新、12.7% 是自动打分

最能说明 RL 有效性的,是一个没参与训练的测试集 DeepSWE v1.1 上的变化:Flash 从 48.8 涨到 65.7(约 +17 分),Pro 从 58.4 涨到 72.6(约 +14 分)。训练任务的平均通过率分别相对提升了约 25% 和 12%。

小米也公开承认了踩的坑:稀疏路由在训练中出现严重的稳定性问题,最后把 router 冻结住才继续跑下去。

四、跑分对比

4.1 唯一独立的那个分数:Artificial Analysis 智能指数

Artificial Analysis 是第三方评测机构。在它的 Intelligence Index v4.3 上:

模型AA 智能指数
Claude Fable 5.1 / GPT-6 Astra更高(第一梯队)
MiMo-V2.6-Pro46
Grok 4.746(同日发布,持平)
Grok 4.644
Gemini 3.8 Flash41
DeepSeek V4.1 Flash39
DeepSeek V4.1 Pro36
MiMo-V2.6-Flash无评分

46 分让 MiMo-V2.6-Pro 成为当前开源权重模型里的第一。Artificial Analysis 对它的另一组测量是:跑完一个智能指数任务的成本约 0.13 美元,输出速度约 134 tokens/秒

注意表格最后一行:Flash 没有 AA 页面,也就是说本文后面所有 Flash 的分数都来自小米自己的评测。

4.2 官方跑分表:与 Opus 5、GPT-5.6 Sol、Fable 5 逐项对比

这张表来自 MiMo-V2.6-Pro 的官方 model card,最后一列是上一代 MiMo-V2.5-Pro:

评测项MiMo-V2.6 ProMiMo-V2.6 FlashMiMo-V2.5 ProClaude Opus 5GPT-5.6 SolClaude Fable 5
代码 Agent
DeepSWE v1.171.967.919.074.073.070.0
ProgramBench26.526.012.537.025.033.0
MiMo Code Bench63.261.240.468.659.3-
通用 Agent
AutomationBench v1.0.653.152.316.050.345.846.2
Toolathlon-Verified76.973.649.180.674.977.9
GDPval-AA 2.11673-1107170815881595
Agents’ Last Exam31.627.613.231.630.825.7
Terminal Bench 4.034.928.81.549.039.942.4
Terminal Bench 2.189.987.665.289.188.884.3
OSWorld-Verified82.080.8-83.483.086.0
JobBench62.061.225.065.745.457.4
网络安全
CyberGym94.095.140.0---
MiMo Cyber Bench80.277.20.0---
ExploitGym17.86.00.222.130.328.4
ExploitBench47.925.316.670.078.578.0
SEC Bench Pro66.347.517.7-79.1-

4.3 怎么读这张表

赢的地方:

  • Terminal Bench 2.1:89.9,高于 Claude Opus 5 的 89.1、GPT-5.6 Sol 的 88.8、Claude Fable 5 的 84.3。命令行任务是 Agent 的核心场景,这个第一有含金量。
  • AutomationBench(53.1)、JobBench(62.0):超过 GPT-5.6 Sol 和 Claude Fable 5,JobBench 略低于 Opus 5 的 65.7。
  • Agents’ Last Exam:31.6,与 Claude Opus 5 完全持平,超过另外两家。
  • CyberGym:94.0(Flash 是 95.1)——但这个项目只有小米报数,其他家是空缺,不能当作对比胜利。

输的地方(这些同样重要):

  • 编程:DeepSWE v1.1 是 71.9,落后 Opus 5 的 74.0 和 Sol 的 73.0;ProgramBench 只有 26.5,明显低于 Opus 5 的 37.0 和 Fable 5 的 33.0。
  • 长程终端任务:Terminal Bench 4.0 只有 34.9,Opus 5 是 49.0。这个项目和 Terminal Bench 2.1 的结论正好相反,说明它在"更长、更难的命令行任务"上掉得比较快。
  • 渗透与漏洞利用:这是差距最大的地方。ExploitBench 47.9 对 Sol 的 78.5;SEC Bench Pro 66.3 对 Sol 的 79.1;ExploitGym 17.8 对 Sol 的 30.3。官方宣传里"网络安全"是亮点,但真正偏攻击侧的评测它并不占优。
  • 桌面操作:OSWorld-Verified 82.0,低于 Fable 5 的 86.0。

Pro 与 Flash 的差距:

多数项目只差 1 到 4 分(DeepSWE 71.9 对 67.9,Terminal Bench 2.1 是 89.9 对 87.6,OSWorld 是 82.0 对 80.8),CyberGym 上 Flash 甚至反超(95.1 对 94.0)。

需要长链条推理、没有部分分的任务上差距会被放大:ExploitGym 是 17.8 对 6.0,整整三倍;SEC Bench Pro 是 66.3 对 47.5;ExploitBench 是 47.9 对 25.3。这符合直觉——420 亿激活参数对 150 亿,差距就应该出现在这种地方。

五、API 价格对比

5.1 MiMo 三档

API 模型输入(缓存未命中)输出输入(缓存命中)上下文
mimo-v2.6-flash$0.14$0.28$0.00281M
mimo-v2.6-pro$0.435$0.87$0.00361M
mimo-v2.6-pro-ultraspeed$4.35$8.70$0.0361M

单位是美元 / 百万 token。三档之间有个规律:UltraSpeed 的价格正好是标准 Pro 的 10 倍,换的是最多 20 倍的输出速度——这个买卖值不值,取决于你的场景对延迟有多敏感。

5.2 横向对比(16 个模型)

下面这张表是我在 2026 年 9 月 22 日通过 OpenRouter 的公开模型接口实时抓取的(MiMo 三档的价格与小米官方价目一致):

模型输入输出缓存命中输入上下文
DeepSeek V4 Flash$0.049$0.098$0.00981M
MiMo-V2.6-Flash$0.14$0.28$0.00281M
Qwen3.8 Flash$0.15$0.47$0.0161M
DeepSeek V4.1 Flash$0.15$0.6$0.0031M
GPT-5.6 Luna$0.2$1.2$0.021.05M
MiMo-V2.6-Pro$0.435$0.87$0.00361M
Gemini 3.8 Flash$0.75$3.75$0.0751M
Kimi K2.6$0.95$4$0.16262K
Grok 4.7$1.6$4.8$0.4500K
GPT-5.6 Sol$2$10$0.21.05M
Qwen3.8 Max$2$6$0.251M
Kimi K3$3$15$0.31M
MiMo-V2.6-Pro-UltraSpeed$4.35$8.70$0.0361M
Claude Opus 5$5$25$0.51M
Claude Fable 5.1$10$50$0.251M
GPT-6 Astra$10$50$11.05M

换算成直观的说法:MiMo-V2.6-Pro 的输入价格是 Claude Opus 5 的 1/11,输出价格是 1/29;对标 Grok 4.7 是输入 1/3.7、输出 1/5.5。小米自己的宣传口径是"同等智能水平下,价格只有海外模型的 1/20 到 1/60"——考虑到 AA 指数上它跟 Grok 4.7 打平、比 Fable 5.1 低一档,这个说法在头部档位上是站得住的。

5.3 两个反直觉的点

第一,最便宜的不是它。 DeepSeek V4 Flash 在 OpenRouter 上是每百万 token 输入 0.049 美元、输出 0.098 美元,比 MiMo-V2.6-Flash 还便宜一半多。所以"MiMo 是全网最便宜"是错的——它在同能力档位里很便宜,但绝对价格不是地板。VentureBeat 的评价是"第二便宜的主要前沿模型",这个定位比较准确。

第二,缓存价才是省钱的关键。 MiMo-V2.6-Pro 的缓存命中输入价是 $0.0036,相比未命中的 $0.435 打了 99% 的折扣。Flash 是 $0.0028。这意味着在 Agent 场景里——同一个长系统提示词、同一份代码库反复调用——真实的边际成本远低于价目表上那个数字。桌面客户端也把这点做成了卖点:会话内缓存命中率最高 99%,跨会话最高 95%。

六、桌面客户端与产品矩阵

跟模型同步上线的还有 MiMo Desktop 桌面客户端和会员订阅。这是小米第一次把模型能力包成一个面向普通专业用户的桌面应用。

  • 平台:Windows 和 Mac(Apple 芯片)。官网明确标注暂不支持韩国、英国及欧盟成员国。
  • 付费方式:两条路——订阅会员,或者自带 API Key(也就是你可以只用客户端,把请求打到自己的 key 上)。
  • 内置 UltraSpeed:桌面客户端首发就带 Pro 的 UltraSpeed 模式,官方说法是最多 20 倍推理速度,面向实时交互场景。
  • 能力上它明显是冲着"完整交付任务"去的:把 PPT、文档、表格、定时任务和文件整理交给它;根据任务类型和成本自动调度(Smart 调度);复杂任务拆成子任务多 Agent 并行;产出可以直接拖入多类文件当上下文,成果覆盖 PPT、网页、3D 和 App;内置浏览器操控,能自己打开网页、填表单、验证结果。
  • 订阅入口:早先的邀测(9 月 8 日开放)随正式发布结束,已获得资格的用户切换模型名后可继续用。

小米的产品矩阵现在有四条线:MiMo API(开放平台)、MiMo StudioMiMo Code(终端编程 Agent)、MiMo Claw(Agent 平台,与 WPS 生态打通,限时 ¥14.9/月)。桌面客户端订阅的具体档位价格官网是动态渲染的,以官网实时价目为准。

七、自部署门槛

MIT 协议意味着可以商用、可以自己部署,但先把磁盘算清楚。我查了两个权重仓库的实际体积:

模型仓库总体积文件数
MiMo-V2.6-Pro-RL573.5 GB155
MiMo-V2.6-Flash-RL177.8 GB90

官方 model card 里给了 SGLangvLLM 两套部署方案,不是"自己想办法"。但现实一点说:Flash 的 178 GB 是一个团队租机器能自己扛的量级,Pro 的 574 GB 基本是集群决策。

另外小米还开放了 7000 多个 RL 任务环境(覆盖软件工程、漏洞复现、知识密集型工作、网页设计开发四类)、端到端 RL 框架和可组合的 mini-harness。9B 蒸馏模型从 SFT 基线出发做了 RL,11 个评测全部提升,比如 SWE-bench Verified 从 61.1 到 66.2、Terminal Bench 2.1 从 37.1 到 52.8。这部分对做训练研究的人价值最大。

八、怎么选:三条规则

默认用 Flash。 0.14 和 0.28 的价格、1M 上下文、同样的全模态能力,多数 Agent 任务它跟 Pro 只差一点。高频调用、批量处理、分类抽取、多 Agent 循环,全部从 Flash 开始。

只在"失败代价高"的任务上升 Pro。 判断标准不是任务难不难,而是失败要不要重来。差 4 分的 DeepSWE 在"重试一次就能救回来"的流程里不值 3 倍价格;但在没有部分分、一步错就全废的任务里,那 4 分就是全部。

延迟真的值钱时才用 UltraSpeed。 10 倍价格换最多 20 倍速度,只有在交互式场景里才算得过账。

九、保留意见与坑

写这篇之前我把官方公告、两份 model card 和第三方报道都过了一遍,下面这些是必须说清的:

  • 跑分绝大多数是厂商自测。除 Artificial Analysis 的 46 分之外,第四节的 Agent 跑分表全部来自小米自己的 harness 和 grader,没有第三方复现。表里的小数点看着精确,但换个 grader 或重试策略,一两个点的差距就可能反转。
  • Flash 完全没有独立评分。AA 只有 Pro 的页面。这意味着你为 Flash 省下的三分之二成本,是建立在一张自测表上的——上线前务必用自己的真实任务集测一遍。
  • 编程和攻击性安全是明确短板。ProgramBench 26.5、Terminal Bench 4.0 34.9、ExploitBench 47.9,这几项跟 Opus 5 和 Sol 都有明显差距。冲着"编程最强"来的话,它不是答案。
  • “网络安全强"要打个折。CyberGym 94.0 很亮眼,但那是防御侧、且只有小米报数;偏攻击侧的 ExploitGym / ExploitBench 它并不占优。
  • 价格便宜是进口替代逻辑,不是绝对最低。DeepSeek V4 Flash 更便宜。
  • “1/20 到 1/60"是小米的宣传口径,不是第三方测算,我只把它当厂商说法保留。
  • 最长输出 128K 出自媒体报道,官方 model card 只写了 1M 上下文,没有明确输出上限,用之前建议自己在文档里确认。
  • API 是标准 OpenAI 兼容接口。我实测探测 https://api.xiaomimimo.com/v1/models 返回 401 并要求 API Key——也就是说它是标准的 /v1 接口,可以直接填进任何支持 OpenAI 格式的客户端或 Agent 框架的 base_url。本文没有实测过完整调用(没有 key),这点如实说明。

参考