结论先行:MiniMax(稀宇科技)在 2025 年 6 月 17 日发布的 MiniMax-M1,是一枚主打开源的大规模混合架构推理模型。它把参数量做到 4560 亿(456B),上下文输入上限拉到 100 万 Token,推理输出长度做到 8 万 Token;而整套训练只用了 512 块 H800 GPU、历时 3 周,官方公布的总成本不到 54 万美元。对需要在长上下文里做软件工程、工具调用和复杂推理的团队而言,这是当时开源阵营里性价比相当突出的选项。
MiniMax-M1 是什么:混合架构推理模型的定位
M1 的定位是”推理模型”(reasoning model)——这类模型在给出最终答复前,会先生成一段较长的内部思考,再输出结果,因此在数学推导、代码修改、多步规划这类任务上,通常比同规模的通用对话模型更稳。它被称为”全球首个开源大规模混合架构推理模型”,关键词其实是两点:大规模与开源。
在它之前,开源社区里已经出现过不少推理模型,但参数规模、上下文长度、推理输出长度这三项同时达到该量级的产品并不多。M1 的做法是把三个指标一次性拉到同一水平线,再连权重一起放出。
核心参数与技术亮点
4560 亿参数与 100 万 Token 上下文
根据官方公布的数据,M1 拥有高达 4560 亿(456B)参数,支持最长 100 万 Token 的上下文输入。100 万 Token 大致对应几十万到上百万汉字的文本量,意味着模型可以一次性读完一份超长文档或中型代码仓库,再基于完整上下文作答,而不必先切片检索。这对”仓库级问答”这类场景是决定性的差别——切片检索会丢上下文,而丢上下文往往意味着答非所问。
业内最长的 8 万 Token 推理输出
推理模型的一大特征是输出里包含大量思考内容,输出上限直接决定它能”想多久”。M1 实现了 8 万 Token 的推理输出上限,官方称这是当时业内最长的水平。实际意义在于:模型可以在一次回答里完成相当长的多步推导,减少中途被截断导致的推理中断。
闪电注意力机制与 CISPO 强化学习算法
M1 的效率优势来自两项自研技术:闪电注意力机制与自研强化学习算法 CISPO。官方表示这套组合让训练效率提升一倍——这也解释了为什么它能在 512 块 H800 上、用 3 周时间和不到 54 万美元完成一轮完整训练。训练成本的下降,最终会传导到 API 定价上。
为什么训练成本值得单独关注
过去几年,”大模型 = 烧钱”几乎是行业共识,动辄数千万美元的训练投入把大多数团队挡在了门外。54 万美元这个数字的意义不在于绝对金额小,而在于它证明了架构与算法优化可以成倍压缩训练开销:同样是前沿级别的推理能力,靠更高效的注意力实现和更稳的强化学习算法,就能把门槛往下压一个数量级。
对下游用户的影响很直接——当训练不再是天文数字,厂商就有空间给出免费额度与低价 API,研究者也能在消费级或小规模集群上做复现实验。
关键规格一览
| 维度 | MiniMax-M1 规格 | 说明 |
|---|---|---|
| 参数规模 | 4560 亿(456B) | 混合架构推理模型 |
| 上下文输入上限 | 100 万 Token | 可一次性载入长文档或中型代码库 |
| 推理输出上限 | 8 万 Token | 官方称业内最长,降低推理中断概率 |
| 注意力机制 | 闪电注意力(自研) | 配合 CISPO,训练效率提升一倍 |
| 训练资源 | 512 块 H800 GPU,历时 3 周 | 官方公布总成本不到 54 万美元 |
| 开放方式 | Hugging Face、GitHub 开源 | 另提供 App / Web / API 访问 |
评测表现:17 项主流基准
官方在 17 项主流评测中考察了 M1,其中在软件工程、长文本理解与工具使用三类生产力任务上表现尤为突出。官方口径是:部分能力超越 OpenAI o3 与 Claude 4 Opus,整体仅次于 Gemini 2.5 Pro。
这里有个容易被忽略的细节——”部分能力超越”是差异性描述,并非所有基准的整体超越。真正做技术选型时,稳妥的做法是按自己的任务集跑一轮回归测试,而不是直接照搬榜单排名。
开源与获取方式
MiniMax 宣布 M1 已通过 Hugging Face 和 GitHub 完整开源,同时在 App/Web 端与 API 平台提供免费及低价访问政策。这实际上给了两条路径:
- 自部署:从开源仓库获取权重自行部署,适合手上有 GPU、对数据出境敏感或需要改造推理链路的团队。
- 云端调用:直接走官方 API 或 App/Web,适合先验证效果,再决定是否投入算力。
选型建议是先用云端低成本跑通自己的真实任务,确认收益后再评估私有化部署的必要性——顺序反过来的话,很容易白花一轮显卡钱。
常见问题(FAQ)
Q1:MiniMax-M1 可以商用吗?
M1 已通过 Hugging Face 与 GitHub 完整开源。具体商用条款建议以下载前查看开源仓库中随附的许可证文件为准,不同版本的权重可能采用不同授权。
Q2:M1 最适合哪类任务?
官方评测中提到它在软件工程、长文本理解与工具使用等生产力任务上表现突出。换言之,代码修改、仓库级问答、长文档分析、需要多步调用外部工具的场景,是它相对擅长的方向。
Q3:普通开发者如何最快上手?
若暂无 GPU 资源,可先通过 MiniMax 的 App 或 Web 端体验效果;官方同时提供 API 且有免费额度与低价政策,适合做原型验证。确认效果后,再考虑拉取开源权重做私有化部署。
小结
MiniMax-M1 的价值不在单一榜单刷分,而在于把”大参数 + 长上下文 + 长推理输出”三件事打包开源,并用闪电注意力与 CISPO 把训练开销压到 54 万美元以内。对整个开源生态来说,这类模型把原本只属于闭源旗舰的能力区间往下挪了一档;对开发者来说,则多了一个既能本地运行、也能低成本调用的长上下文推理选项。
