结论先行:面壁智能联合 OpenBMB 开源了 2B 参数的端侧语言基座模型 MiniCPM5-2B。它在 Artificial Analysis 榜单位列全球 4B 以下开源模型第一,综合 23 分,其中 Agentic Index 拿到 20 分——约为同级模型的十倍。除权重外,项目还一口气开放了 UltraData 数据集、自研强化学习框架 Meshy 和训练策略 JustRL II,并完成英特尔、瑞芯微、Arm 等平台的 Day0 适配。
核心数据一览
| 项目 | 数值 / 说明 |
|---|---|
| 模型 | MiniCPM5-2B |
| 参数规模 | 2B |
| 定位 | 端侧语言基座模型 |
| AA 榜单 | 全球 4B 以下开源模型第一 |
| 综合得分 | 23 分 |
| Agentic Index | 20 分,约为同级十倍 |
| 同步开源 | UltraData 数据、Meshy 框架、JustRL II |
| 硬件适配 | 英特尔、瑞芯微、Arm 等 Day0 支持 |
| 系列下载量 | 截至 2026 年 8 月,MiniCPM 系列全球下载突破 5000 万次 |
难点:端侧模型为什么通常做不了 Agent
工具调用、深度搜索、代码生成,这三项能力在过去基本是大模型的专属。对 2B 参数的端侧模型而言,既要压住显存和功耗,又要维持多步规划的稳定性,难度不在单点能力,而在能力的组合方式。
MiniCPM5-2B 给出的答案是把 Agent 能力从预训练阶段就注入,而不是靠后期微调硬补。
三段式训练:预训练 → SFT → 大规模 RL
| 阶段 | 做法 | 数据 |
|---|---|---|
| Agentic 预训练 | 预训练阶段就大规模注入 Agent 相关语料,让模型从起点理解工具调用与任务规划 | — |
| Agent SFT | 用真实 Agent 交互轨迹做监督微调,教会工具调用、写代码、搜索 | UltraData-SFT-Agent-2609,约 50 万条样本 |
| 大规模 Agent RL | 强化学习对齐 Agent 行为,提升复杂任务中的自主规划与纠错能力 | UltraData-RL-2609,经三轮清洗的 8 万余条样本 |
值得注意的是数据规模本身就传达了取向:50 万条 SFT 样本对 8 万余条 RL 样本,重点放在”教会默认行为”,再用规模更小但清洗三轮的数据做能力精修。
训练栈也一并开源:Meshy 与 JustRL II
这次开源最实在的部分,是把”怎么练出来的”整套链路交了出来,而不是只丢一个 checkpoint。
Meshy:拆掉中央控制器
Meshy 是面壁自研的强化学习框架,去掉了传统 RL 训练里的中央控制器和 Ray 依赖,把训练、推理、奖励计算全部拆分成对等服务。同步、异步、全异步三种训练模式可以随时切换,横向扩展的成本明显下降。对没有大规模集群的团队来说,这类”去依赖”的工程改动往往比算法 trick 更能决定能不能跑起来。
JustRL II:给 GRPO 装一个 Critic
JustRL II 解决的是一个很具体的痛点:端侧模型做长思维链强化学习时,经常出现越训分越低的情况。原因有两层——训练数据噪声大,以及 GRPO 的信用分配太粗糙,面对上万个 token 的推理链分不清哪一步对、哪一步错。
| 层面 | 做法 |
|---|---|
| 数据侧 | 三阶段流水线筛选校准,压噪声 |
| 算法侧 | 给 GRPO 增加 Critic 模块,把信用分配粒度提升到 token 级 |
MiniCPM5-2B 的 RL 阶段用的正是这套方案。
Day0 适配意味着什么
模型发布的同时完成英特尔、瑞芯微、Arm 等平台的 Day0 适配,这件事的重要性常被低估。端侧模型的价值只有在真实芯片上跑起来才能兑现,等到社区自行适配通常要滞后数周甚至数月。Day0 支持相当于把”能跑”这件事提前到了发布当天。
配套的社群基础也值得一提:截至 2026 年 8 月,MiniCPM 系列开源模型全球下载量已突破 5000 万次。对于要在生产环境引入的团队,下载量与生态成熟度本身就是一种隐性风险评估指标。
适合用在哪:场景对照
| 场景 | 适配理由 | 注意事项 |
|---|---|---|
| 手机 / 平板本地助理 | 2B 体量对内存友好,Day0 覆盖 Arm 平台 | 复杂多步任务仍需设计兜底逻辑 |
| PC 端侧工具调用 | Agentic Index 20 分支撑工具调用与任务规划 | 单机算力有限,注意并发与延迟 |
| 离线隐私场景 | 本地推理,数据不出设备 | 知识时效性依赖基座训练语料 |
| 嵌入式 / 边缘设备 | 瑞芯微等平台已适配 | 需实测量化后的能力衰减 |
FAQ
1. Agentic Index 20 分”约为同级十倍”该怎么理解?
Agentic Index 衡量的是模型完成 Agent 类任务(工具调用、规划、执行链)的综合表现。官方口径是 20 分约为同级模型的十倍,结合综合 23 分一起看,说明这个模型的分数结构高度偏向 Agent 侧——这正是它的设计目标,而非意外。
2. 2B 模型真的能在手机上跑起来吗?
“能跑”和”跑得好”是两件事。2B 参数加上 Day0 适配保证了前者;后者取决于量化精度、芯片算力和具体任务的复杂度。建议在目标设备上用真实任务做一轮端到端压测,而不是只看榜单分数。
3. UltraData、Meshy、JustRL II 对普通开发者有用吗?
取决于目的。如果只是调用模型,权重足够;如果想复现训练过程或针对垂直场景二次训练,这三件套的价值比权重本身更高——它们提供的是可复现、可验证的路径,而不是黑箱结果。
小结
MiniCPM5-2B 的意义可以概括为一句话:把 Agent 能力从小模型身上”长出来”,而不是从大模型身上”缩下去”。20 分的 Agentic Index 是结果,真正的原因在于 Agentic 预训练加 50 万条 SFT 轨迹的设计取向,以及 Meshy 与 JustRL II 这两件工程武器。对端侧 AI 来说,这类”连训练方法一起开源”的做法,长期看比发一个更好的分数更有价值。
相关阅读
这条线上还有几篇站内文章可以接着看:
- MiniCPM-V 4.6 发布:1.3B 参数挑战多模态极限,手机上就能跑
- Ling-3.0-flash-VL 开源:124B 参数仅激活 5.5B,256K 上下文原生多模态
- Meta 开源 Muse Glimmer:30B 本地代理模型,一张消费级显卡跑满血智能体
延伸阅读
- 微软 UFO² 桌面 AgentOS 解析:自动化成功率 32.7%,超越 OpenAI Operator 且 MIT 开源1 天前
- agentic-eCAL 实测多智能体能耗:跨 5G 与光链路的文本传输仅占 0.25%,成本在 GPU 推理3 天前
- 英伟达开源 SoL-Pi,智能体 token 消耗降约 49%1 天前
- Kimi 发布金融行业解决方案:9 项金融技能+5 项合规,受托报告 30 分钟缩至 10 分钟3 天前
