小米 9 月 23 日把 MiMo-V2.6 系列的两个原生全模态模型同时开源,Pro 与 Flash 两条线一起放出。整套方案走的是 RSI 路径,也就是递归自我改进。具体训练周期上,官方公开的说法是约 6 天 Live RL 训练,其中 Flash 的训练成本约 85 万美元,Pro 的训练成本约 262 万美元,两条线各完成 30 步训练,累计产出 75 万条轨迹。
从外部可观察的指标看,最直接的变化是 DeepSWE v1.1 长程软件工程基准。Flash 由 48.8 提升至 65.68,Pro 由 58.4 提升至 72.57。Artificial Analysis Intelligence Index 上 Pro 拿到 46 分。AAII 这种第三方榜单一向偏综合分,单看绝对值意义有限,但同代际内部升级幅度 17 分以上属于显著提升。
训练规模与算力配置
6 天 Live RL 训练的关键参数来自小米官方披露。单次更新使用 1568 个样本,单步训练 Token 量介于 27 亿到 37 亿之间,上下文长度训练支持到最高 1M Token。任务覆盖代码、通用任务、视觉理解与网络安全四个方向,并混合多种 Agent Harness,让模型在不同智能体框架之间具备切换能力。
| 参数 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 训练时长 | 约 6 天 Live RL | |
| 训练步数 | 30 步 | 30 步 |
| 累计轨迹 | 约 75 万条(双模型合计) | |
| 训练成本 | 约 262 万美元 | 约 85 万美元 |
| 单次更新样本量 | 1568 | |
| 单步训练 Token 量 | 27 亿 至 37 亿 | |
| 上下文训练上限 | 1M Token | |
基准与能力变化
DeepSWE v1.1 是这次对外最重要的数字。Pro 由 58.4 跳到 72.57,Flash 由 48.8 跳到 65.68,两个版本都跑出了 17 分左右的提升。这一基准衡量的是长程软件工程任务,对应的是 Agent 在真实仓库里跑多轮修改、测试、提交的综合表现。AAII 上 Pro 拿到 46 分,这个分数需要结合具体测试设置看,模型在真实业务中的效果仍需结合任务验证。
从代码到 3D 与具身
MiMo-V2.6 不止覆盖代码。多模态感知、3D 空间推理、Computer Use 是这次明确放出的能力。模型可以从文字、图片、视频构建 3D 开放世界,在 Blender 里辅助完成三维建模;可以通过视觉反馈操作办公软件、处理数据、检查任务结果。在具身仿真环境里,模型展示了控制机械臂完成物体抓取、颜色匹配、精准放置的能力。
科研与创作
科研场景下,MiMo-V2.6-Pro 被用于材料设计、文献与专利检索、计算实验以及 Lean 4 形式化证明。创作场景下,模型可以生成前端网页、PPT、SVG、视频与音乐,并且能协调代码、设计、多媒体工具完成较完整的创作流程。这些能力在文本里只是描述,真正能不能在生产环境跑通还要看实际接入后的稳定性。
开源与可用性
本次同步开放 MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B 三个版本,配套提供 7000 余个高质量 RL 任务环境、端到端训练框架与轻量级 mini-harnesses。所有资源已上线 Hugging Face。普通用户可以通过 MiMo Desktop 桌面端使用,开发者则通过开放平台 API 接入。Pro 版本额外提供 UltraSpeed 高速模式,官方称最高可获得普通模式约 20 倍的输出速度。
常见问题
MiMo-V2.6 是开源的吗
是。Pro、Flash、Distill-Qwen-9B 三个版本同步开源,配套训练框架与 7000+ RL 任务环境也一并放出。资源集中在 Hugging Face。
Pro 与 Flash 该怎么选
长程软件工程任务优先 Pro,DeepSWE 72.57 比 Flash 高出 7 分左右。预算紧、追求吞吐则选 Flash,训练成本只有 Pro 的约三分之一。需要高速输出时,Pro 的 UltraSpeed 模式能拉到 20 倍速,是性价比更高的路径。
UltraSpeed 要额外付费吗
从目前的 API 计费文档看,UltraSpeed 与普通模式沿用同一套定价,具体以开放平台计费规则为准。训练成本不应该直接换算成 API 价格,但官方放出 20 倍速这个数字说明推理优化做得比较深。
小结
小米这次同时扔出三组信号:训练成本、benchmark 升级幅度、可商用 API。RSI 路径继续,6 天 Live RL 训出 75 万条轨迹的能力是底层基础,DeepSWE 72.57 与 AAII 46 分是上层表现,开源三个版本加上 7000+ 任务环境是把研究资产开放给社区。对想拿国产原生全模态模型做长程 Agent 任务的团队来说,MiMo-V2.6 这次是值得认真测一轮的对象。
消息来源:小米开源 MiMo-V2.6 全模态双模型,DeepSWE 跑出 65 与 72 分(aihub.cn)
延伸阅读
- 千问高考志愿填报 Agent 上线免费开放:志愿日历、报告、问答三项能力,去年报告领取近 1300 万份4 天前
- LibTV Agent 上线:首批 100+ 专业 Video Skill,3 分钟内视频一次成片成功率超 80%4 天前
- DeepSeek V4 Flash 正式版来了:Terminal Bench 2.1 冲到 82.7,Agent 能力大幅超越预览版2 月前
- 阿里真武V900发布:算力达M890三倍,单集群50万卡3 天前
