小米MiMo-V2.6开源:75万条轨迹练出72分,端侧Agent能力首次系统超越GPT-6

2026年9月22日,小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。这是小米首次将强化学习规模扩展到「百万样本 + 数十亿Token每步」的量级,并在代码与Agent任务基准上取得显著提升,其中 MiMo-V2.6-Pro 在 DeepSWE v1.1 长程软件工程基准上的得分从58.4升至72.57。

一句话结论

MiMo-V2.6 通过「扩大RL训练规模」而非「堆参数」实现能力跃升,75万美元训练一个版本、6天产75万条轨迹的路径,证明了小团队也能靠算力杠杆追上大厂前沿模型。

核心升级:从「堆参数」到「堆训练」

MiMo-V2.6 与前代最本质的区别,在于训练范式的转变。小米没有单纯扩大模型参数量,而是将资源倾斜至强化学习阶段的规模扩张。官方披露,V2.6-Pro 训练成本约262万美元、Flash 约85万美元,各完成30步训练——这意味着每个版本只用了约6天时间和数百万元预算,就将基准分数提升超过20点。

对比来看,OpenAI、Anthropic 等大厂通常依赖「千亿参数 + 超大规模预训练」的传统 Scaling Law 路径。小米选择「中量参数 + 超大规模RL」的成本结构,对资源有限的团队更具参考价值。

RL规模:单步27亿Token,覆盖4大方向

本次训练的核心突破在于 RL 算力的三维扩展:

这种规模下,模型能完成从「写一段代码」到「独立完成完整项目」的能力跃迁。训练任务混合了多种 Agent Harness,让模型适应不同智能体框架,而非只擅长单一测试场景。

基准测试:DeepSWE 48.8→72.57,代码能力显著提升

最直接反映 MiMo-V2.6 能力的指标来自两个基准:

基准 V2.5 得分 V2.6-Pro V2.6-Flash 提升幅度
DeepSWE v1.1(代码) 58.4 72.57 65.68 +14/+17
Artificial Analysis Index — 46分 — 新增指标

DeepSWE v1.1 考察模型处理真实长程软件工程任务的能力,包括需求理解、多文件修改和自动化测试,72.57分意味着模型能独立完成大多数企业级代码任务。

多模态与具身:3D推理、机械臂控制、Computer Use

除了代码和Agent任务,MiMo-V2.6 还展示了多项具身与多模态能力:

  • 3D空间推理:可根据文字、图片或视频构建3D开放世界,在Blender中辅助完成三维建模;
  • 具身控制:在仿真环境中控制机械臂完成物体抓取、颜色匹配和精准放置;
  • Computer Use:通过视觉反馈操作办公软件、处理数据并检查任务结果;
  • 科研辅助:材料设计、文献检索、计算实验以及 Lean 4 形式化证明。

这些能力的系统整合,使 MiMo-V2.6 成为少数能够覆盖「代码 → 具身 → 科研」全链路的开源模型。

开源内容:3个模型 + 7000+任务环境 + 训练框架

本次开源包含三项核心资产:

  • 模型权重:MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B;
  • 任务环境:7000余个高质量RL任务环境;
  • 训练框架:端到端训练框架与轻量级 mini-harnesses。

所有模型与资源已上线 Hugging Face,普通用户可通过 MiMo Desktop 直接使用,开发者则可通过开放平台API接入。

定价:沿用旧版价格,UltraSpeed 最高20倍速

MiMo-V2.6 系列沿用上一代API定价,Pro版本额外提供 UltraSpeed 高速模式,官方称最高可获得普通模式约20倍的输出速度,适合对延迟敏感的生产场景。

FAQ:3个核心问题

1. MiMo-V2.6 与上一代相比最大改进是什么?

核心在于RL训练规模的量级提升,而非模型架构或参数量的剧变。V2.6-Pro 训练成本约262万美元、6天完成30步训练,将 DeepSWE 基准分数从58.4提升至72.57,证明了「规模化RL」是中小团队可行的追赶路径。

2. MiMo-V2.6 的开源对开发者有什么实际价值?

除了模型权重,小米还开源了7000余个高质量RL任务环境、端到端训练框架和轻量级 mini-harnesses。这意味着开发者可以复现整个RL训练流程、研究自己的任务环境,或直接基于现成权重做推理部署,无需从零搭建。

3. 小米这套「强化学习规模化」路线能否复制?

从成本结构看,75万美元训练一个版本、6天完成迭代,对中等规模团队是可及的。关键门槛在于高质量任务环境的构建(7000+任务覆盖代码/通用/视觉/安全)和RL算力调度能力,而非单纯资金投入。已有自研模型的团队可以参考这套范式做定向能力提升。

小结

MiMo-V2.6 的发布标志着「算力换智能」路径在开源社区的实质性落地。75万美元、6天、30步训练——用这个成本结构做出72分的代码Agent能力,小米验证了RL规模化对中小团队的可行性。随着开源任务环境与训练框架的社区跟进,这套方法的迭代成本还将进一步下降,有望成为下一个被广泛复制的开源模型训练范式。

相关阅读: