结论先行:小米于 2026 年 9 月 21 日发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两款全模态模型,权重以 MIT 协议开放、可直接从 Hugging Face 下载。Pro 以 1.02 万亿总参数 / 420 亿激活参数、1M 上下文,在第三方 Artificial Analysis 智能指数 v4.3 上拿到 46.32 分,与同日发布的 Grok 4.7 持平,而 API 输入价格只有后者的约五分之一。更值得注意的是:价格与上代 V2.5 完全持平——智能涨了,钱没涨。
一、这次到底发布了什么
两个原生全模态检查点,同时开源,外加一个托管专属的加速版本:
| 项目 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 总参数 / 激活参数 | 1.02T / 42B | 309B / 15B |
| 层数 | 70 层 | 48 层(39 滑动窗口 + 9 全注意力) |
| 路由专家 | 384 个,每 token 激活 8 个 | 256 个,每 token 激活 8 个,无共享专家 |
| 上下文 / 输出上限 | 1,048,576 token / 128,000 token | |
| 输入模态 | 文本、图像、视频、音频(输出为文本) | |
| 许可证 | MIT,权重无门槛(ungated) | |
| RL 训练成本 | 约 262 万美元 | 约 85 万美元 |
两个模型共享同一套多模态栈:6.81 亿参数视觉编码器、3.08 亿参数音频 tokenizer、1.27 亿参数音频 patch encoder,以及一个五层 MTP 投机解码器——按模型卡说法,单次前向可草案 7 个未来 token,这是万亿 MoE 还能跑出可用速度的关键。
第三个变体 MiMo-V2.6-Pro-UltraSpeed 是托管专属而非第三个开源检查点:输出速度最高约为 Pro 的 20 倍,代价是 10 倍价格($4.35 / $8.70 每百万 token),走桌面客户端与 API。
二、价格:与 Grok 4.7 同日发布,差了一个数量级
| 模型 | 输入(美元/百万 token) | 输出(美元/百万 token) | 缓存命中输入 | AA 智能指数 |
|---|---|---|---|---|
| MiMo-V2.6-Pro | 0.435 | 0.87 | 约 0.0036 | 46.32 |
| MiMo-V2.6-Flash | 0.14 | 0.28 | 约 0.0028 | 未公布 |
| Grok 4.7 | 2.00 | 6.00 | — | 46 |
| Grok 4.6 | 2.00 | 6.00 | — | 44 |
| Gemini 3.8 Flash | — | — | — | 41 |
同一档智能,Pro 的输入价格是 Grok 4.7 的 21.8%、输出是 14.5%。Artificial Analysis 按任务口径测算,Pro 约 $0.13 每次指数任务、输出约 134 token/秒,落在智能—成本帕累托前沿上。此外 Batch API 为实时价格的半价。
对小团队最有感的一点:这套价格与 MiMo-V2.5 系列完全一致。已经在调用 V2.5 接口的开发者,等于免费拿到了一次智能升级。
三、跑分:第三方指数是可信的,Agent 分数请打折看
需要把两类数字分开对待。
第三方可复核的:Artificial Analysis Intelligence Index v4.3 上 Pro 得 46.32 分,上代 MiMo-V2.5-Pro 为 26 分,提升约 20 分,并登顶开放权重模型分类。同榜单 Grok 4.7 为 46、Grok 4.6 为 44、Gemini 3.8 Flash 为 41、DeepSeek V4.1 Flash 为 39。
厂商自测的:DeepSWE v1.1(Agent 修 bug)71.9,略高于 Grok 4.7 的 71.0;Terminal Bench 2.1 为 89.9;AutomationBench 为 53.1。这些数据来自小米自己的表格,且未公开评测所用的 harness,在第三方复现前建议按”厂商口径”看待。Code Arena 的 AutoEval 给出 Pro 1628 分(V2.5-Pro 为 1475),但那是奖励模型估算值,不是真人投票终值。
Pro 比 Flash 强多少?多数场景只差 1–4 分
小米自己的对比表一共 15 行,读下来最有价值的信息是:旗舰的领先幅度普遍很小。
| 评测项 | Pro | Flash |
|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 |
| MiMo Code Bench | 63.2 | 61.2 |
| AutomationBench v1.0.6 | 53.1 | 52.3 |
| Toolathlon-Verified | 76.9 | 73.6 |
| Terminal Bench 2.1 | 89.9 | 87.6 |
| OSWorld-Verified | 82.0 | 80.8 |
| MiMo Visual Coding | 72.3 | 71.5 |
| CyberGym | 94.0 | 95.1 |
| MiMo Cyber Bench | 80.2 | 77.2 |
唯一一行 Flash 反超的是 CyberGym(95.1 对 94.0)。考虑到 Flash 价格只有 Pro 的三分之一,如果任务失败与成功之间的差距不在那一两个点上,Flash 是更划算的默认值。
四、真正的看点:260 万美元买来的 RL 方法论
小米这次不只放权重,还把训练过程与工具链一并公开了——这部分比参数更有长期价值。
规模与预算分配。两个模型各跑 30 个大 RL 步、约 75 万条轨迹,六天内完成。Pro 花约 262 万美元、Flash 约 85 万美元。有意思的是钱花在哪:只有 43.5% 用于训练本身,43.8% 用于生成 rollout,12.7% 用于打分。也就是说,超过一半的预算花在”制造经验”和”评判经验”上,而不是更新权重。单步规模为 1,568 个 prompt × 16 次采样,约 2.5 万条 rollout、27 亿–37 亿训练 token,单条序列平均 11 万–15 万 token——强化的是完整 Agent 工作流,不是短答案。
You Only RL Once。代码、视觉、计算机操作、网络安全不做分头训练,而是混进同一次 RL run,配合各领域的轻量 mini-harness,让模型接触不同的系统提示词、工具与上下文管理策略,避免与某一种生产脚手架过拟合。基础设施侧用全异步 GRPO:长任务结束时间不一致,未完成的轨迹会被中断、稍后续跑,GPU 靠部分 rollout 保持满载;样本混合机制防止”又快又简单”的任务家族霸占每个批次;RL 期间冻结 MoE 路由以抑制训练漂移。
教模型”干净地解题”。二元奖励只能判断测试过没过,分不清一个最小补丁和一份塞满兜底逻辑、多余 API 改动与脆弱 workaround 的补丁。小米的解法是 Groupwise Reward Synthesis(对同一问题多次尝试做横向比较,生成任务专属评分标准,把”实现质量”和”Agent 行为”分开打分)与 Groupwise Advantage Redistribution(在同一组内比较通过方案,把训练优势向更优者倾斜)。反证也很实在:Flash 在去掉在线分组打分的代码 RL 中,轮数与 token 长度一路攀升直到撞上长度上限。
开源清单
- 权重:MiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL(MIT),以及用于社区 RL 实验的 MiMo-V2.6-Distill-Qwen-9B
- 7000+ 分类任务环境,覆盖软件开发、漏洞复现、知识劳动、网页设计
- 基于 verl 的端到端 RL 框架与可组合 mini-harness
- vLLM 首日支持:原生 FP8 权重、MiMo 推理与工具调用 parser、DFlash 投机解码
五、别被 MIT 三个字骗了
1.02 万亿参数模型的”自由使用”,实际门槛是硬件——需要多卡集群才能跑起来,而小米没有给出任何自部署的硬件指引。MIT 解决的是法律问题,不是工程问题。对绝大多数团队,这次开源的现实价值在于”可读、可研究、可蒸馏”(Distill-Qwen-9B 就是给这条路准备的),而不是”自己部署一份”。
另外,Flash 至今没有第三方指数分数,厂商表格中的 Agent 分数也未被外部复现。选型时请把”46.32″和”71.9″当作两类可信度不同的证据。
六、开发者怎么上手
托管入口包括小米 AI Studio、MiMo Code、MiMo Desktop、MiMo API 平台与 OpenRouter;API 地址为 platform.xiaomimimo.com,免费体验入口为 aistudio.xiaomimimo.com。自部署走 Hugging Face 权重 + vLLM(首日已支持)。
FAQ
Q1:Pro 和 Flash 应该怎么选?
看任务失败的代价。两者在小米自己的 15 行对比表中多数相差 1–4 分,Flash 价格约为 Pro 的三分之一。若工作流对”差两分”敏感(如自动化修 bug 是否通过测试),用 Pro;若只是要一个可接受的答案(路由、分类、抽取、批量 Agent 执行),Flash 的经济性明显更好。
Q2:MIT 协议意味着可以商用和自托管吗?
法律上可以,商用、修改、再分发都不受限,权重在 Hugging Face 上无门槛下载。但 Pro 是 1T 参数的 MoE,实际自托管需要可观的多卡资源,官方未提供硬件配置建议;中小团队更现实的路径是通过 API 或等待社区蒸馏版本。
Q3:和同日发布的 Grok 4.7 相比值不值得换?
第三方综合指数两者基本持平(46.32 对 46),但 Pro 输入价格约为 Grok 4.7 的五分之一、输出约为七分之一,且权重可下载。Grok 4.7 的优势在于托管服务的成熟度和生态接入。已在用 Grok 且对延迟与生态有依赖的,可先拿 Flash 跑对照;成本敏感的批量 Agent 场景,Pro/Flash 更划算。
小结
MiMo-V2.6 把三件事同时往一个方向推了:能力、推理经济性、面向 Agent 的后训练。更值得琢磨的是它的姿态——公开 RL 全流程、公开 7000+ 环境、公开 260 万美元的预算构成,等于把”怎么把基座模型训成能干活的 Agent”这道当前最贵的题,连同草稿纸一起发出来。开放权重在这个尺度上,与其说是在送模型,不如说是在送方法论。
相关阅读
- 小米 MiMo-V2.6 RL 训练全程公开:单步 20 亿 Token,双版本训练成本破 128 万美元
- 小米 MiMo-V2-Pro 发布:1T 总参数 42B 激活、1M 上下文,API 定价约为同级竞品 1/5
- Grok 4.7 正式发布解析:2.1 万亿参数涨 40% 不涨价
消息来源:小米官方模型卡与发布页、Hugging Face 模型仓库、Artificial Analysis Intelligence Index v4.3、DataNorth、i-SCOOP、OrcaRouter、AI IDE List、AI Primer。
