小米 MiMo-V2-Pro 发布:1T 总参数 42B 激活、1M 上下文,API 定价约为同级竞品 1/5

结论先行:小米正式发布旗舰 Agent 基座模型 Xiaomi MiMo-V2-Pro,总参数量超过 1T、激活参数 42B,支持 1M 超长上下文,采用 7:1 比例的 Hybrid Attention 混合注意力架构,参数规模较上代 MiMo-V2-Flash 扩大约 3 倍。定价上,256K 以内输入 1 美元/百万 tokens、输出 3 美元/百万 tokens,官方称约为同级竞品的 1/5

架构与规格:为长上下文和 Agent 场景做的取舍

MiMo-V2-Pro 最显眼的两个数字是”1T 总参数 / 42B 激活参数”。这种大总量、小激活的设计,本质上是用稀疏化换推理成本:总容量用来装知识,实际每次推理只调动一小部分权重。

Hybrid Attention 的 7:1 比例

模型采用创新的 Hybrid Attention 混合注意力架构,比例为 7:1。这类混合注意力方案的核心目标,是在长上下文场景下把注意力的计算开销压下来——全注意力在百万级 token 上的代价极高,混合方案让模型在大部分层用更便宜的注意力变体,只在关键层保留完整注意力。这解释了它为什么能同时做到 1M 上下文和相对可控的定价。

相比上代扩大了约 3 倍

官方资料显示,MiMo-V2-Pro 较上代 MiMo-V2-Flash 参数规模扩大约 3 倍。容量提升主要服务于两类场景:长文理解,以及 Agent 任务中反复出现的长轨迹上下文。

跑分与实测:全球第八、国内第二

在 Artificial Analysis 全球综合智能排行榜上,MiMo-V2-Pro 位列全球第八、国内第二。这个榜单衡量的是综合智能表现,前排位置基本被海外头部模型占据。

Agent 端到端体验:超越 Sonnet 4.6,逼近 Opus 4.6

更值得关注的是实际体感。据小米公布的信息,在 OpenClaw、Claude Code 等 Agent 框架的端到端任务测试中,MiMo-V2-Pro 的整体使用体感超越 Claude Sonnet 4.6、逼近 Opus 4.6;Coding 能力在小米内部工程师评测中体感接近 Opus 4.6。

此外,在面向 Agent 框架的标准化评测榜单 PinchBench 和 ClawEval 上,MiMo-V2-Pro 位居全球顶尖。这两个榜单考察的是模型在真实 Agent 工作流里的表现,与单纯的答题能力不完全重合。

发布前的”匿名跑分”:Hunter Alpha

一个有意思的细节是,该模型在正式发布前以匿名模型 Hunter Alpha 的身份在 OpenRouter 上测试运行了一周,调用量突破 1T tokens,多天登顶日榜。这种先匿名实测、再正式发布的做法,能拿到不受品牌滤镜影响的真实使用数据。正式版经持续迭代后,在长文能力和 Agent 场景稳定性方面进一步提升。

API 定价:按上下文长度分段计价

上下文区间 输入价格(美元/百万 tokens) 输出价格(美元/百万 tokens)
256K 以内 1 3
1M 以内 2 6

上表价格来自小米公布的官方定价。分段计价的设计逻辑很直接:短上下文任务按低价档结算,需要超长上下文时才进入高价档,避免用户为用不上的窗口买单。官方给出的整体判断是约为同级竞品的 1/5。

发布同期,小米还联合 OpenClaw、KiloCode、Cline 等 Agent 框架团队,为开发者提供限时一周的免费接口支持。

生态接入:从手机到办公套件

模型能力的价值最终取决于触达用户的路径。MiMo-V2-Pro 已同步接入 WPS 灵犀、小米手机端智能体 miclaw 以及小米浏览器。

MiMo Claw 打通金山 WebOffice

MiMo Studio 同步上线 MiMo Claw,原生打通金山 WebOffice,支持 Word、Excel、PPT、PDF 四大格式免费体验。对办公场景来说,这一步比单纯的 API 开放更关键——它让模型能力直接落在用户已有的文档工作流里。

开发者入口

API 接入地址为 platform.xiaomimimo.com,免费体验入口为 aistudio.xiaomimimo.com。

FAQ:开发者最关心的问题

Q1:MiMo-V2-Pro 适合什么任务?

从官方定位看,它是面向 Agent 场景的基座模型,重点优化长上下文与 Agent 任务稳定性,适合长文档理解、多步骤工具调用、代码 Agent 等场景。

Q2:1M 上下文的实际成本怎么算?

按小米公布的定价,1M 以内上下文输入 2 美元/百万 tokens、输出 6 美元/百万 tokens;若任务在 256K 以内,则按 1 美元 / 3 美元档结算。

Q3:和普通聊天模型相比有什么不同?

MiMo-V2-Pro 的评测重点放在 Agent 框架下的端到端任务表现(如 PinchBench、ClawEval),强调长轨迹稳定执行,而不是单轮对话的流畅度。

小结

MiMo-V2-Pro 的组合拳可以概括为一句话:用稀疏架构和混合注意力把长上下文成本压下来,再用约同级 1/5 的定价去换 Agent 开发者的迁移意愿。全球第八、国内第二的综合排名说明它已经进入第一梯队讨论范围,而匿名实测一周破 1T tokens 的调用量,则从侧面验证了需求真实存在。对正在选型 Agent 基座的团队,这是一个值得放进对比清单的新选项。