小米 MiMo-V2.6 RL 训练全程公开:单步 20 亿 Token,双版本训练成本破 128 万美元

小米 MiMo 大模型团队负责人罗福莉在 X 平台发文,首次公开最新大模型 MiMo-V2.6 的强化学习(RL)训练进展,并同步上线实时训练页面,把 RL 阶段的进度、Token 消耗与成本指标做成对外直播。结论先行:这不是一次模型发布,而是把大模型训练里最不透明的一环——强化学习阶段——主动摊开给外界看。据公开的训练页面数据,MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两个版本累计训练成本已超过 128 万美元,整体折合每小时支出超 3 万美元。

这次公开的到底是什么阶段

需要先厘清一件事:MiMo-V2.6 目前尚未发布,它正处在 RL 运行的中途。这次公开的是「正在训练中的状态」,而不是一个可下载、可调用的成品模型。这也正是它的稀缺之处——预训练阶段的算力规模早已是行业公开的谈资,但 RL 阶段的参数、rollout 配置与成本曲线,此前几乎从未有团队以直播形式对外展示。

罗福莉在文中给出的定位是探索「强化学习能走多远」。围绕这个目标,团队在三个维度上同时做扩展。

三个扩展维度:算力、环境、评估

三个维度分别解决不同问题:算力维度决定一次更新能并行处理多少样本,环境维度决定任务与工具生态有多宽,评估维度决定奖励信号能不能精准落到具体动作上。三者缺一,RL 的扩展就会卡在最窄的那一环。

扩展维度 具体做法 作用
计算资源 单步约 20 亿 Token(1568 个 Prompt × 16 次 rollout),完全异步并行 提升单步样本吞吐,缩短反馈周期
环境与测试框架 多任务代理式 RL,单次运行内混合多个测试框架 让智能体在同一轮训练中接触异构任务环境
评估计算 代理式组内信用分配,带测试用例与基于量规的奖励 把奖励细化到组内单个动作,缓解稀疏奖励

其中「组内信用分配」值得多说一句。Agent 类任务的一条轨迹往往包含数十次工具调用,如果只在结尾给一个总分,模型很难判断是哪一步做对了、哪一步走歪了。带测试用例的组内信用分配,本质是把奖励信号从「结果层」下沉到「步骤层」,这也是当前 Agent RL 工程里最难做、也最影响上限的部分。

训练成本拆解:每小时烧掉 3 万美元

实时训练页面同时展示了进度、Token 消耗、成本、样本数量与若干内部指标,其中包含两个并行版本。按页面公开数据整理如下:

版本 累计训练时长 累计成本 折合每小时
MiMo-V2.6-Pro 约 1 天 19 小时 约 89 万美元 超 2 万美元
MiMo-V2.6-Flash 约 1 天 14 小时 约 39.7 万美元 超 1 万美元
两版本合计 超 128 万美元 超 3 万美元

把这个数字放回上下文会更好理解:它只是强化学习这一个阶段的开销,不包含此前的预训练与中期训练。对前沿大模型而言,RL 正在从「最后一公里的打磨」变成独立的成本中心。

为什么 RL 阶段这么贵

原因在于 RL 的算力消耗结构与预训练完全不同。预训练是一次前向加反向、数据静态可复用;RL 则需要先让模型生成大量 rollout 样本,再对环境反馈做评估与信用分配,最后才回到参数更新。1568 个 Prompt 各跑 16 次 rollout,意味着每一步都要先付出一整轮推理的代价,而这部分算力无法像预训练数据那样反复摊薄。环境侧混合多个测试框架、评估侧引入测试用例,又进一步抬高了单步成本。

团队背景:罗福莉与 MiMo 的来路

公开信息显示,罗福莉是北京师范大学计算机专业本科、北京大学计算语言学硕士,毕业后加入阿里巴巴达摩院机器智能实验室,负责多语言预训练模型 VECO 的研发并推动 AliceMind 项目开源,此后参与 DeepSeek-V2 研发。她于去年 11 月正式加盟小米,执掌 MiMo 大模型团队。

团队此前的成绩是今年 3 月发布的万亿参数模型 MiMo-V2-Pro,在 Artificial Analysis 全球大模型综合智能榜位列第八(品牌榜第五)。当时小米创始人雷军曾公开提及这一排名,并表示后续将保持快速迭代。

从「黑盒试错」到「过程开源」

这次动作真正值得关注的不是成本数字,而是公开的对象。以往厂商公开的是结果——跑分、榜单、论文;过程则被视为工程秘密。而实时训练页面展示的是正在进行中的实验:单步 Token 规模、rollout 配置、成本曲线、内部指标。对做 RL 工程的人来说,这类中间态信息的参考价值往往高于一份结论性的技术报告。

按罗福莉的表述,相关技术细节将在未来数周内逐步开源。如果这一步兑现,它推动的是前沿大模型训练从「黑盒试错」向「极客级过程开源」的范式演进——至少在 RL Scaling Law 这条路上,外界第一次有机会对照真实工程数据,而不是只能从最终模型反推训练策略。

常见问题

MiMo-V2.6 现在已经可以下载或调用了吗?

还不能。按公开信息,该模型正处于强化学习训练运行的中途,尚未发布,本次公开的是训练过程与实时指标,不是模型权重或 API 服务。

128 万美元的训练成本包含哪些部分?

这是实时训练页面呈现的 RL 阶段累计成本,涵盖 MiMo-V2.6-Pro(约 89 万美元)与 MiMo-V2.6-Flash(约 39.7 万美元)两个并行版本,随训练推进仍在增长,不包含此前的预训练等阶段开销。

技术细节会公开到什么程度?

罗福莉表示将在未来数周内逐步开源相关技术细节。目前可确认的是训练配置与成本指标已实时公开,具体开源范围与时间点需以团队后续公布为准。

小结

MiMo-V2.6 这次公开的价值,不在于又多了一个「参数更大」的模型,而在于它把 RL 阶段的工程细节与真实成本摆到了台面上:单步 20 亿 Token 的异步并行、混合多框架的代理式环境、下沉到步骤层的组内信用分配,以及每小时超 3 万美元的账单。对行业来说,这类过程数据比榜单名次更能说明前沿模型训练的门槛究竟在哪里。