MiniMax-M1 开源推理模型解析:4560 亿参数、100 万 Token 上下文,54 万美元完成训练

结论先行:MiniMax(稀宇科技)在 2025 年 6 月 17 日发布的 MiniMax-M1,是一枚主打开源的大规模混合架构推理模型。它把参数量做到 4560 亿(456B),上下文输入上限拉到 100 万 Token,推理输出长度做到 8 万 Token;而整套训练只用了 512 块 H800 GPU、历时 3 周,官方公布的总成本不到 54 万美元。对需要在长上下文里做软件工程、工具调用和复杂推理的团队而言,这是当时开源阵营里性价比相当突出的选项。

MiniMax-M1 是什么:混合架构推理模型的定位

M1 的定位是”推理模型”(reasoning model)——这类模型在给出最终答复前,会先生成一段较长的内部思考,再输出结果,因此在数学推导、代码修改、多步规划这类任务上,通常比同规模的通用对话模型更稳。它被称为”全球首个开源大规模混合架构推理模型”,关键词其实是两点:大规模开源

在它之前,开源社区里已经出现过不少推理模型,但参数规模、上下文长度、推理输出长度这三项同时达到该量级的产品并不多。M1 的做法是把三个指标一次性拉到同一水平线,再连权重一起放出。

核心参数与技术亮点

4560 亿参数与 100 万 Token 上下文

根据官方公布的数据,M1 拥有高达 4560 亿(456B)参数,支持最长 100 万 Token 的上下文输入。100 万 Token 大致对应几十万到上百万汉字的文本量,意味着模型可以一次性读完一份超长文档或中型代码仓库,再基于完整上下文作答,而不必先切片检索。这对”仓库级问答”这类场景是决定性的差别——切片检索会丢上下文,而丢上下文往往意味着答非所问。

业内最长的 8 万 Token 推理输出

推理模型的一大特征是输出里包含大量思考内容,输出上限直接决定它能”想多久”。M1 实现了 8 万 Token 的推理输出上限,官方称这是当时业内最长的水平。实际意义在于:模型可以在一次回答里完成相当长的多步推导,减少中途被截断导致的推理中断。

闪电注意力机制与 CISPO 强化学习算法

M1 的效率优势来自两项自研技术:闪电注意力机制与自研强化学习算法 CISPO。官方表示这套组合让训练效率提升一倍——这也解释了为什么它能在 512 块 H800 上、用 3 周时间和不到 54 万美元完成一轮完整训练。训练成本的下降,最终会传导到 API 定价上。

为什么训练成本值得单独关注

过去几年,”大模型 = 烧钱”几乎是行业共识,动辄数千万美元的训练投入把大多数团队挡在了门外。54 万美元这个数字的意义不在于绝对金额小,而在于它证明了架构与算法优化可以成倍压缩训练开销:同样是前沿级别的推理能力,靠更高效的注意力实现和更稳的强化学习算法,就能把门槛往下压一个数量级。

对下游用户的影响很直接——当训练不再是天文数字,厂商就有空间给出免费额度与低价 API,研究者也能在消费级或小规模集群上做复现实验。

关键规格一览

维度 MiniMax-M1 规格 说明
参数规模 4560 亿(456B) 混合架构推理模型
上下文输入上限 100 万 Token 可一次性载入长文档或中型代码库
推理输出上限 8 万 Token 官方称业内最长,降低推理中断概率
注意力机制 闪电注意力(自研) 配合 CISPO,训练效率提升一倍
训练资源 512 块 H800 GPU,历时 3 周 官方公布总成本不到 54 万美元
开放方式 Hugging Face、GitHub 开源 另提供 App / Web / API 访问

评测表现:17 项主流基准

官方在 17 项主流评测中考察了 M1,其中在软件工程、长文本理解与工具使用三类生产力任务上表现尤为突出。官方口径是:部分能力超越 OpenAI o3 与 Claude 4 Opus,整体仅次于 Gemini 2.5 Pro。

这里有个容易被忽略的细节——”部分能力超越”是差异性描述,并非所有基准的整体超越。真正做技术选型时,稳妥的做法是按自己的任务集跑一轮回归测试,而不是直接照搬榜单排名。

开源与获取方式

MiniMax 宣布 M1 已通过 Hugging Face 和 GitHub 完整开源,同时在 App/Web 端与 API 平台提供免费及低价访问政策。这实际上给了两条路径:

  • 自部署:从开源仓库获取权重自行部署,适合手上有 GPU、对数据出境敏感或需要改造推理链路的团队。
  • 云端调用:直接走官方 API 或 App/Web,适合先验证效果,再决定是否投入算力。

选型建议是先用云端低成本跑通自己的真实任务,确认收益后再评估私有化部署的必要性——顺序反过来的话,很容易白花一轮显卡钱。

常见问题(FAQ)

Q1:MiniMax-M1 可以商用吗?

M1 已通过 Hugging Face 与 GitHub 完整开源。具体商用条款建议以下载前查看开源仓库中随附的许可证文件为准,不同版本的权重可能采用不同授权。

Q2:M1 最适合哪类任务?

官方评测中提到它在软件工程、长文本理解与工具使用等生产力任务上表现突出。换言之,代码修改、仓库级问答、长文档分析、需要多步调用外部工具的场景,是它相对擅长的方向。

Q3:普通开发者如何最快上手?

若暂无 GPU 资源,可先通过 MiniMax 的 App 或 Web 端体验效果;官方同时提供 API 且有免费额度与低价政策,适合做原型验证。确认效果后,再考虑拉取开源权重做私有化部署。

小结

MiniMax-M1 的价值不在单一榜单刷分,而在于把”大参数 + 长上下文 + 长推理输出”三件事打包开源,并用闪电注意力与 CISPO 把训练开销压到 54 万美元以内。对整个开源生态来说,这类模型把原本只属于闭源旗舰的能力区间往下挪了一档;对开发者来说,则多了一个既能本地运行、也能低成本调用的长上下文推理选项。