2026年9月22日,小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。这是小米首次将强化学习规模扩展到「百万样本 + 数十亿Token每步」的量级,并在代码与Agent任务基准上取得显著提升,其中 MiMo-V2.6-Pro 在 DeepSWE v1.1 长程软件工程基准上的得分从58.4升至72.57。
一句话结论
MiMo-V2.6 通过「扩大RL训练规模」而非「堆参数」实现能力跃升,75万美元训练一个版本、6天产75万条轨迹的路径,证明了小团队也能靠算力杠杆追上大厂前沿模型。
核心升级:从「堆参数」到「堆训练」
MiMo-V2.6 与前代最本质的区别,在于训练范式的转变。小米没有单纯扩大模型参数量,而是将资源倾斜至强化学习阶段的规模扩张。官方披露,V2.6-Pro 训练成本约262万美元、Flash 约85万美元,各完成30步训练——这意味着每个版本只用了约6天时间和数百万元预算,就将基准分数提升超过20点。
对比来看,OpenAI、Anthropic 等大厂通常依赖「千亿参数 + 超大规模预训练」的传统 Scaling Law 路径。小米选择「中量参数 + 超大规模RL」的成本结构,对资源有限的团队更具参考价值。
RL规模:单步27亿Token,覆盖4大方向
本次训练的核心突破在于 RL 算力的三维扩展:
- 单次更新使用1568个样本;
- 最高支持1M上下文长度训练;
- 单步训练Token量达到27亿至37亿;
- 覆盖代码、通用任务、视觉理解、网络安全四大方向。
- 全球AI大模型周调用量129万亿:中国连续21周超美国
这种规模下,模型能完成从「写一段代码」到「独立完成完整项目」的能力跃迁。训练任务混合了多种 Agent Harness,让模型适应不同智能体框架,而非只擅长单一测试场景。
基准测试:DeepSWE 48.8→72.57,代码能力显著提升
最直接反映 MiMo-V2.6 能力的指标来自两个基准:
| 基准 | V2.5 得分 | V2.6-Pro | V2.6-Flash | 提升幅度 |
|---|---|---|---|---|
| DeepSWE v1.1(代码) | 58.4 | 72.57 | 65.68 | +14/+17 |
| Artificial Analysis Index | — | 46分 | — | 新增指标 |
DeepSWE v1.1 考察模型处理真实长程软件工程任务的能力,包括需求理解、多文件修改和自动化测试,72.57分意味着模型能独立完成大多数企业级代码任务。
多模态与具身:3D推理、机械臂控制、Computer Use
除了代码和Agent任务,MiMo-V2.6 还展示了多项具身与多模态能力:
- 3D空间推理:可根据文字、图片或视频构建3D开放世界,在Blender中辅助完成三维建模;
- 具身控制:在仿真环境中控制机械臂完成物体抓取、颜色匹配和精准放置;
- Computer Use:通过视觉反馈操作办公软件、处理数据并检查任务结果;
- 科研辅助:材料设计、文献检索、计算实验以及 Lean 4 形式化证明。
这些能力的系统整合,使 MiMo-V2.6 成为少数能够覆盖「代码 → 具身 → 科研」全链路的开源模型。
开源内容:3个模型 + 7000+任务环境 + 训练框架
本次开源包含三项核心资产:
- 模型权重:MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B;
- 任务环境:7000余个高质量RL任务环境;
- 训练框架:端到端训练框架与轻量级 mini-harnesses。
所有模型与资源已上线 Hugging Face,普通用户可通过 MiMo Desktop 直接使用,开发者则可通过开放平台API接入。
定价:沿用旧版价格,UltraSpeed 最高20倍速
MiMo-V2.6 系列沿用上一代API定价,Pro版本额外提供 UltraSpeed 高速模式,官方称最高可获得普通模式约20倍的输出速度,适合对延迟敏感的生产场景。
FAQ:3个核心问题
1. MiMo-V2.6 与上一代相比最大改进是什么?
核心在于RL训练规模的量级提升,而非模型架构或参数量的剧变。V2.6-Pro 训练成本约262万美元、6天完成30步训练,将 DeepSWE 基准分数从58.4提升至72.57,证明了「规模化RL」是中小团队可行的追赶路径。
2. MiMo-V2.6 的开源对开发者有什么实际价值?
除了模型权重,小米还开源了7000余个高质量RL任务环境、端到端训练框架和轻量级 mini-harnesses。这意味着开发者可以复现整个RL训练流程、研究自己的任务环境,或直接基于现成权重做推理部署,无需从零搭建。
3. 小米这套「强化学习规模化」路线能否复制?
从成本结构看,75万美元训练一个版本、6天完成迭代,对中等规模团队是可及的。关键门槛在于高质量任务环境的构建(7000+任务覆盖代码/通用/视觉/安全)和RL算力调度能力,而非单纯资金投入。已有自研模型的团队可以参考这套范式做定向能力提升。
小结
MiMo-V2.6 的发布标志着「算力换智能」路径在开源社区的实质性落地。75万美元、6天、30步训练——用这个成本结构做出72分的代码Agent能力,小米验证了RL规模化对中小团队的可行性。随着开源任务环境与训练框架的社区跟进,这套方法的迭代成本还将进一步下降,有望成为下一个被广泛复制的开源模型训练范式。
相关阅读:
- 谷歌EmbeddingGemma2开源:740M参数塞进手机,端侧多模态检索首次轻量落地
- OpenAI把GPT-6推向全体ChatGPT用户:回答变成可操作界面
- 阶跃STEPX Neo:首款L3智能体手机13日亮相
- Google开放SynthID Detector:上传即查AI水印,1800亿张图已嵌标记
延伸阅读
- OpenAI 发布 GPT-6.1 Sol:输入 $2/百万,编码任务胜出 6.4%1 周前
- Anthropic 发 Claude Sonnet 5.5:对半价,速度快 30%1 周前
- Tabbit AI 浏览器公测:美团光年之外用 Agent、妙招、脚本三大模块把浏览器变成执行平台2 周前
- ChatGPT for Teens上线College Planner:AI助手切入美本申请1 天前
