先说结论
2026 年 9 月 22 日,小米发布并开源了 MiMo-V2.6 系列。三个要点:
- Pro 是当前最强开源模型。1.02 万亿总参数、420 亿激活,在第三方评测机构 Artificial Analysis 的智能指数上拿到 46 分,跟三天内发布的 Grok 4.7 打平,超过 Kimi K3 和 Qwen3.8 Max。
- Flash 才是大多数人该用的那个。3090 亿总参数、150 亿激活,API 价格只有 Pro 的三分之一,但在小米自己的 Agent 跑分表上,多数项目跟 Pro 只差 1 到 4 分。
- 价格是它最锋利的武器。Pro 每百万 token 输入 0.435 美元、输出 0.87 美元,Flash 是 0.14 和 0.28。同一档能力里,这是海外模型价格的几分之一。
但也有两条冷水:官方跑分表里编程类和渗透测试类仍然是明显短板;除 Artificial Analysis 那个 46 分之外,本文所有 Agent 分数都是小米自测,没有第三方复现。
一、这次发布了什么
一句话:两款开源权重模型 + 一个托管加速模式 + 一个小尺寸蒸馏模型,外加配套的 RL 训练环境和代码。
| 型号 | 定位 | 架构 | 上下文 | 权重 |
|---|---|---|---|---|
| MiMo-V2.6-Pro | 旗舰 | 1.02T 总参 / 42B 激活 稀疏 MoE | 1M | MIT,开放下载 |
| MiMo-V2.6-Flash | 高性价比主力 | 309B 总参 / 15B 激活 稀疏 MoE | 1M | MIT,开放下载 |
| MiMo-V2.6-Pro-UltraSpeed | 托管加速模式 | 与 Pro 同权重,推理侧加速 | 1M | 不开权重,仅 API |
| MiMo-V2.6-Distill-Qwen-9B | 蒸馏小模型 | 基于 Qwen 的 9B 蒸馏 | — | MIT,开放下载 |
几个值得单独说的点:
- 全模态是原生的,不是外挂一个视觉塔:文本、图像、视频、音频都能直接吃。视频理解和音频理解在同一个模型里,不是几个专用模型拼起来的。
- 1M 上下文对两个主力型号是标配,不分档位。按 VentureBeat 的报道,最长输出 128K tokens。
- API 价格与上一代 V2.5 完全一致。小米的说法是"同一价格,更高智能",也就是说这次升级对老用户是免费的。
- 模型名全小写:调 API 时用
mimo-v2.6-pro、mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed。
二、架构:一个稀疏 MoE,加一层被"冻结"的路由
两款主力都是稀疏混合专家(MoE)架构,但尺寸差得很多。以下是官方 model card 里的架构表:
| 项目 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 总参 / 激活参数 | 1.02T / 42B | 309B / 15B |
| 层数(总 / 滑动窗口 / 全局) | 70 / 60 / 10 | 48 / 39 / 9 |
| 隐藏维度 | 6144 | 4096 |
| 路由专家(总数 / 激活) | 384 / 8 | 256 / 8 |
| 滑动窗口大小 | 128 | 128 |
| 最大上下文 | 1M | 1M |
| 投机解码 | 5 层 MTP | 5 层 MTP |
两个模型共享同一套多模态编码器:681M 参数的 MiMo ViT 视觉编码器(28 层,24 层滑动窗口 + 4 层全局注意力)、308M 的音频 tokenizer 和 127M 的音频 patch 编码器。
架构上有三个细节值得记:
- 第一个 Transformer block 用全局注意力加稠密 FFN,往后才开始路由。这是为了让初始 token 表示先稳定下来,再交给专家网络——稀疏模型训练不稳的常见解法。
- 混合注意力:大部分层是滑动窗口注意力(窗口只有 128),少数层做全局注意力。Pro 是 60:10,Flash 是 39:9。这是把 1M 上下文做到可负担的关键——如果全用全局注意力,长上下文的计算量会直接爆掉。
- 5 层 MTP(多 token 预测)投机解码器:推理时一次猜多个 token,再批量验证。这是它跑得快的原因之一。
至于 UltraSpeed(超速模式),原理是三层叠加:FP4 无损量化 把权重压到 4 位、DFlash 并行解码 让草稿模型一次填满一整个 block、以及 TileRT 在系统层做 kernel 持久化和计算-传输重叠。官方口径是最多 20 倍输出速度,同样的质量。
三、训练:六天、75 万条轨迹、347 万美元
这次发布里最反常识的数字不是跑分,是训练成本。
小米给这次 RL 训练起了个名字叫 You Only RL Once——不再按任务类型分别训练,而是把编程、通用 Agent、视觉操作、网络安全四类任务混进同一个强化学习批次里一起训。
关键数字按官方公告整理:
- 两个模型各完成 30 个 RL step,累计约 75 万条轨迹
- 每个 step 用 1568 个 prompt,每个 prompt 生成 16 条 rollout,约 2.5 万条轨迹
- 每个 step 消耗 35 亿到 37 亿 tokens,平均序列长度 11 万到 15 万 tokens
- 全部完成用了 不到 6 天
- 训练成本:Flash 约 85.4 万美元,Pro 约 262 万美元(合计约 347 万美元)
- 自动评分占了算力的一部分:Pro 的开销里约 43.8% 是 rollout 生成、43.5% 是参数更新、12.7% 是自动打分
最能说明 RL 有效性的,是一个没参与训练的测试集 DeepSWE v1.1 上的变化:Flash 从 48.8 涨到 65.7(约 +17 分),Pro 从 58.4 涨到 72.6(约 +14 分)。训练任务的平均通过率分别相对提升了约 25% 和 12%。
小米也公开承认了踩的坑:稀疏路由在训练中出现严重的稳定性问题,最后把 router 冻结住才继续跑下去。
四、跑分对比
4.1 唯一独立的那个分数:Artificial Analysis 智能指数
Artificial Analysis 是第三方评测机构。在它的 Intelligence Index v4.3 上:
| 模型 | AA 智能指数 |
|---|---|
| Claude Fable 5.1 / GPT-6 Astra | 更高(第一梯队) |
| MiMo-V2.6-Pro | 46 |
| Grok 4.7 | 46(同日发布,持平) |
| Grok 4.6 | 44 |
| Gemini 3.8 Flash | 41 |
| DeepSeek V4.1 Flash | 39 |
| DeepSeek V4.1 Pro | 36 |
| MiMo-V2.6-Flash | 无评分 |
46 分让 MiMo-V2.6-Pro 成为当前开源权重模型里的第一。Artificial Analysis 对它的另一组测量是:跑完一个智能指数任务的成本约 0.13 美元,输出速度约 134 tokens/秒。
注意表格最后一行:Flash 没有 AA 页面,也就是说本文后面所有 Flash 的分数都来自小米自己的评测。
4.2 官方跑分表:与 Opus 5、GPT-5.6 Sol、Fable 5 逐项对比
这张表来自 MiMo-V2.6-Pro 的官方 model card,最后一列是上一代 MiMo-V2.5-Pro:
| 评测项 | MiMo-V2.6 Pro | MiMo-V2.6 Flash | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|---|---|
| 代码 Agent | ||||||
| DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| ProgramBench | 26.5 | 26.0 | 12.5 | 37.0 | 25.0 | 33.0 |
| MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | - |
| 通用 Agent | ||||||
| AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |
| Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |
| GDPval-AA 2.1 | 1673 | - | 1107 | 1708 | 1588 | 1595 |
| Agents’ Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 1.5 | 49.0 | 39.9 | 42.4 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |
| OSWorld-Verified | 82.0 | 80.8 | - | 83.4 | 83.0 | 86.0 |
| JobBench | 62.0 | 61.2 | 25.0 | 65.7 | 45.4 | 57.4 |
| 网络安全 | ||||||
| CyberGym | 94.0 | 95.1 | 40.0 | - | - | - |
| MiMo Cyber Bench | 80.2 | 77.2 | 0.0 | - | - | - |
| ExploitGym | 17.8 | 6.0 | 0.2 | 22.1 | 30.3 | 28.4 |
| ExploitBench | 47.9 | 25.3 | 16.6 | 70.0 | 78.5 | 78.0 |
| SEC Bench Pro | 66.3 | 47.5 | 17.7 | - | 79.1 | - |
4.3 怎么读这张表
赢的地方:
- Terminal Bench 2.1:89.9,高于 Claude Opus 5 的 89.1、GPT-5.6 Sol 的 88.8、Claude Fable 5 的 84.3。命令行任务是 Agent 的核心场景,这个第一有含金量。
- AutomationBench(53.1)、JobBench(62.0):超过 GPT-5.6 Sol 和 Claude Fable 5,JobBench 略低于 Opus 5 的 65.7。
- Agents’ Last Exam:31.6,与 Claude Opus 5 完全持平,超过另外两家。
- CyberGym:94.0(Flash 是 95.1)——但这个项目只有小米报数,其他家是空缺,不能当作对比胜利。
输的地方(这些同样重要):
- 编程:DeepSWE v1.1 是 71.9,落后 Opus 5 的 74.0 和 Sol 的 73.0;ProgramBench 只有 26.5,明显低于 Opus 5 的 37.0 和 Fable 5 的 33.0。
- 长程终端任务:Terminal Bench 4.0 只有 34.9,Opus 5 是 49.0。这个项目和 Terminal Bench 2.1 的结论正好相反,说明它在"更长、更难的命令行任务"上掉得比较快。
- 渗透与漏洞利用:这是差距最大的地方。ExploitBench 47.9 对 Sol 的 78.5;SEC Bench Pro 66.3 对 Sol 的 79.1;ExploitGym 17.8 对 Sol 的 30.3。官方宣传里"网络安全"是亮点,但真正偏攻击侧的评测它并不占优。
- 桌面操作:OSWorld-Verified 82.0,低于 Fable 5 的 86.0。
Pro 与 Flash 的差距:
多数项目只差 1 到 4 分(DeepSWE 71.9 对 67.9,Terminal Bench 2.1 是 89.9 对 87.6,OSWorld 是 82.0 对 80.8),CyberGym 上 Flash 甚至反超(95.1 对 94.0)。
但需要长链条推理、没有部分分的任务上差距会被放大:ExploitGym 是 17.8 对 6.0,整整三倍;SEC Bench Pro 是 66.3 对 47.5;ExploitBench 是 47.9 对 25.3。这符合直觉——420 亿激活参数对 150 亿,差距就应该出现在这种地方。
五、API 价格对比
5.1 MiMo 三档
| API 模型 | 输入(缓存未命中) | 输出 | 输入(缓存命中) | 上下文 |
|---|---|---|---|---|
| mimo-v2.6-flash | $0.14 | $0.28 | $0.0028 | 1M |
| mimo-v2.6-pro | $0.435 | $0.87 | $0.0036 | 1M |
| mimo-v2.6-pro-ultraspeed | $4.35 | $8.70 | $0.036 | 1M |
单位是美元 / 百万 token。三档之间有个规律:UltraSpeed 的价格正好是标准 Pro 的 10 倍,换的是最多 20 倍的输出速度——这个买卖值不值,取决于你的场景对延迟有多敏感。
5.2 横向对比(16 个模型)
下面这张表是我在 2026 年 9 月 22 日通过 OpenRouter 的公开模型接口实时抓取的(MiMo 三档的价格与小米官方价目一致):
| 模型 | 输入 | 输出 | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| DeepSeek V4 Flash | $0.049 | $0.098 | $0.0098 | 1M |
| MiMo-V2.6-Flash | $0.14 | $0.28 | $0.0028 | 1M |
| Qwen3.8 Flash | $0.15 | $0.47 | $0.016 | 1M |
| DeepSeek V4.1 Flash | $0.15 | $0.6 | $0.003 | 1M |
| GPT-5.6 Luna | $0.2 | $1.2 | $0.02 | 1.05M |
| MiMo-V2.6-Pro | $0.435 | $0.87 | $0.0036 | 1M |
| Gemini 3.8 Flash | $0.75 | $3.75 | $0.075 | 1M |
| Kimi K2.6 | $0.95 | $4 | $0.16 | 262K |
| Grok 4.7 | $1.6 | $4.8 | $0.4 | 500K |
| GPT-5.6 Sol | $2 | $10 | $0.2 | 1.05M |
| Qwen3.8 Max | $2 | $6 | $0.25 | 1M |
| Kimi K3 | $3 | $15 | $0.3 | 1M |
| MiMo-V2.6-Pro-UltraSpeed | $4.35 | $8.70 | $0.036 | 1M |
| Claude Opus 5 | $5 | $25 | $0.5 | 1M |
| Claude Fable 5.1 | $10 | $50 | $0.25 | 1M |
| GPT-6 Astra | $10 | $50 | $1 | 1.05M |
换算成直观的说法:MiMo-V2.6-Pro 的输入价格是 Claude Opus 5 的 1/11,输出价格是 1/29;对标 Grok 4.7 是输入 1/3.7、输出 1/5.5。小米自己的宣传口径是"同等智能水平下,价格只有海外模型的 1/20 到 1/60"——考虑到 AA 指数上它跟 Grok 4.7 打平、比 Fable 5.1 低一档,这个说法在头部档位上是站得住的。
5.3 两个反直觉的点
第一,最便宜的不是它。 DeepSeek V4 Flash 在 OpenRouter 上是每百万 token 输入 0.049 美元、输出 0.098 美元,比 MiMo-V2.6-Flash 还便宜一半多。所以"MiMo 是全网最便宜"是错的——它在同能力档位里很便宜,但绝对价格不是地板。VentureBeat 的评价是"第二便宜的主要前沿模型",这个定位比较准确。
第二,缓存价才是省钱的关键。 MiMo-V2.6-Pro 的缓存命中输入价是 $0.0036,相比未命中的 $0.435 打了 99% 的折扣。Flash 是 $0.0028。这意味着在 Agent 场景里——同一个长系统提示词、同一份代码库反复调用——真实的边际成本远低于价目表上那个数字。桌面客户端也把这点做成了卖点:会话内缓存命中率最高 99%,跨会话最高 95%。
六、桌面客户端与产品矩阵
跟模型同步上线的还有 MiMo Desktop 桌面客户端和会员订阅。这是小米第一次把模型能力包成一个面向普通专业用户的桌面应用。
- 平台:Windows 和 Mac(Apple 芯片)。官网明确标注暂不支持韩国、英国及欧盟成员国。
- 付费方式:两条路——订阅会员,或者自带 API Key(也就是你可以只用客户端,把请求打到自己的 key 上)。
- 内置 UltraSpeed:桌面客户端首发就带 Pro 的 UltraSpeed 模式,官方说法是最多 20 倍推理速度,面向实时交互场景。
- 能力上它明显是冲着"完整交付任务"去的:把 PPT、文档、表格、定时任务和文件整理交给它;根据任务类型和成本自动调度(Smart 调度);复杂任务拆成子任务多 Agent 并行;产出可以直接拖入多类文件当上下文,成果覆盖 PPT、网页、3D 和 App;内置浏览器操控,能自己打开网页、填表单、验证结果。
- 订阅入口:早先的邀测(9 月 8 日开放)随正式发布结束,已获得资格的用户切换模型名后可继续用。
小米的产品矩阵现在有四条线:MiMo API(开放平台)、MiMo Studio、MiMo Code(终端编程 Agent)、MiMo Claw(Agent 平台,与 WPS 生态打通,限时 ¥14.9/月)。桌面客户端订阅的具体档位价格官网是动态渲染的,以官网实时价目为准。
七、自部署门槛
MIT 协议意味着可以商用、可以自己部署,但先把磁盘算清楚。我查了两个权重仓库的实际体积:
| 模型 | 仓库总体积 | 文件数 |
|---|---|---|
| MiMo-V2.6-Pro-RL | 573.5 GB | 155 |
| MiMo-V2.6-Flash-RL | 177.8 GB | 90 |
官方 model card 里给了 SGLang 和 vLLM 两套部署方案,不是"自己想办法"。但现实一点说:Flash 的 178 GB 是一个团队租机器能自己扛的量级,Pro 的 574 GB 基本是集群决策。
另外小米还开放了 7000 多个 RL 任务环境(覆盖软件工程、漏洞复现、知识密集型工作、网页设计开发四类)、端到端 RL 框架和可组合的 mini-harness。9B 蒸馏模型从 SFT 基线出发做了 RL,11 个评测全部提升,比如 SWE-bench Verified 从 61.1 到 66.2、Terminal Bench 2.1 从 37.1 到 52.8。这部分对做训练研究的人价值最大。
八、怎么选:三条规则
默认用 Flash。 0.14 和 0.28 的价格、1M 上下文、同样的全模态能力,多数 Agent 任务它跟 Pro 只差一点。高频调用、批量处理、分类抽取、多 Agent 循环,全部从 Flash 开始。
只在"失败代价高"的任务上升 Pro。 判断标准不是任务难不难,而是失败要不要重来。差 4 分的 DeepSWE 在"重试一次就能救回来"的流程里不值 3 倍价格;但在没有部分分、一步错就全废的任务里,那 4 分就是全部。
延迟真的值钱时才用 UltraSpeed。 10 倍价格换最多 20 倍速度,只有在交互式场景里才算得过账。
九、保留意见与坑
写这篇之前我把官方公告、两份 model card 和第三方报道都过了一遍,下面这些是必须说清的:
- 跑分绝大多数是厂商自测。除 Artificial Analysis 的 46 分之外,第四节的 Agent 跑分表全部来自小米自己的 harness 和 grader,没有第三方复现。表里的小数点看着精确,但换个 grader 或重试策略,一两个点的差距就可能反转。
- Flash 完全没有独立评分。AA 只有 Pro 的页面。这意味着你为 Flash 省下的三分之二成本,是建立在一张自测表上的——上线前务必用自己的真实任务集测一遍。
- 编程和攻击性安全是明确短板。ProgramBench 26.5、Terminal Bench 4.0 34.9、ExploitBench 47.9,这几项跟 Opus 5 和 Sol 都有明显差距。冲着"编程最强"来的话,它不是答案。
- “网络安全强"要打个折。CyberGym 94.0 很亮眼,但那是防御侧、且只有小米报数;偏攻击侧的 ExploitGym / ExploitBench 它并不占优。
- 价格便宜是进口替代逻辑,不是绝对最低。DeepSeek V4 Flash 更便宜。
- “1/20 到 1/60"是小米的宣传口径,不是第三方测算,我只把它当厂商说法保留。
- 最长输出 128K 出自媒体报道,官方 model card 只写了 1M 上下文,没有明确输出上限,用之前建议自己在文档里确认。
- API 是标准 OpenAI 兼容接口。我实测探测
https://api.xiaomimimo.com/v1/models返回 401 并要求 API Key——也就是说它是标准的/v1接口,可以直接填进任何支持 OpenAI 格式的客户端或 Agent 框架的 base_url。本文没有实测过完整调用(没有 key),这点如实说明。
参考
- 小米 MiMo 官方发布公告:MiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement
- 权重与官方跑分表:MiMo-V2.6-Pro-RL / MiMo-V2.6-Flash-RL / MiMo-V2.6-Distill-Qwen-9B
- 第三方评分:Artificial Analysis(智能指数 v4.3)
- 价格数据:OpenRouter 公开模型接口,2026-09-22 抓取
- 桌面客户端:mimo.xiaomimimo.com/desktop