MiniCPM5-2B 开源:2B 端侧基座,Agentic Index 20 分约为同级十倍

结论先行:面壁智能联合 OpenBMB 开源了 2B 参数的端侧语言基座模型 MiniCPM5-2B。它在 Artificial Analysis 榜单位列全球 4B 以下开源模型第一,综合 23 分,其中 Agentic Index 拿到 20 分——约为同级模型的十倍。除权重外,项目还一口气开放了 UltraData 数据集、自研强化学习框架 Meshy 和训练策略 JustRL II,并完成英特尔、瑞芯微、Arm 等平台的 Day0 适配。

核心数据一览

项目 数值 / 说明
模型 MiniCPM5-2B
参数规模 2B
定位 端侧语言基座模型
AA 榜单 全球 4B 以下开源模型第一
综合得分 23 分
Agentic Index 20 分,约为同级十倍
同步开源 UltraData 数据、Meshy 框架、JustRL II
硬件适配 英特尔、瑞芯微、Arm 等 Day0 支持
系列下载量 截至 2026 年 8 月,MiniCPM 系列全球下载突破 5000 万次

难点:端侧模型为什么通常做不了 Agent

工具调用、深度搜索、代码生成,这三项能力在过去基本是大模型的专属。对 2B 参数的端侧模型而言,既要压住显存和功耗,又要维持多步规划的稳定性,难度不在单点能力,而在能力的组合方式。

MiniCPM5-2B 给出的答案是把 Agent 能力从预训练阶段就注入,而不是靠后期微调硬补。

三段式训练:预训练 → SFT → 大规模 RL

阶段 做法 数据
Agentic 预训练 预训练阶段就大规模注入 Agent 相关语料,让模型从起点理解工具调用与任务规划
Agent SFT 用真实 Agent 交互轨迹做监督微调,教会工具调用、写代码、搜索 UltraData-SFT-Agent-2609,约 50 万条样本
大规模 Agent RL 强化学习对齐 Agent 行为,提升复杂任务中的自主规划与纠错能力 UltraData-RL-2609,经三轮清洗的 8 万余条样本

值得注意的是数据规模本身就传达了取向:50 万条 SFT 样本对 8 万余条 RL 样本,重点放在”教会默认行为”,再用规模更小但清洗三轮的数据做能力精修。

训练栈也一并开源:Meshy 与 JustRL II

这次开源最实在的部分,是把”怎么练出来的”整套链路交了出来,而不是只丢一个 checkpoint。

Meshy:拆掉中央控制器

Meshy 是面壁自研的强化学习框架,去掉了传统 RL 训练里的中央控制器和 Ray 依赖,把训练、推理、奖励计算全部拆分成对等服务。同步、异步、全异步三种训练模式可以随时切换,横向扩展的成本明显下降。对没有大规模集群的团队来说,这类”去依赖”的工程改动往往比算法 trick 更能决定能不能跑起来。

JustRL II:给 GRPO 装一个 Critic

JustRL II 解决的是一个很具体的痛点:端侧模型做长思维链强化学习时,经常出现越训分越低的情况。原因有两层——训练数据噪声大,以及 GRPO 的信用分配太粗糙,面对上万个 token 的推理链分不清哪一步对、哪一步错。

层面 做法
数据侧 三阶段流水线筛选校准,压噪声
算法侧 给 GRPO 增加 Critic 模块,把信用分配粒度提升到 token 级

MiniCPM5-2B 的 RL 阶段用的正是这套方案。

Day0 适配意味着什么

模型发布的同时完成英特尔、瑞芯微、Arm 等平台的 Day0 适配,这件事的重要性常被低估。端侧模型的价值只有在真实芯片上跑起来才能兑现,等到社区自行适配通常要滞后数周甚至数月。Day0 支持相当于把”能跑”这件事提前到了发布当天。

配套的社群基础也值得一提:截至 2026 年 8 月,MiniCPM 系列开源模型全球下载量已突破 5000 万次。对于要在生产环境引入的团队,下载量与生态成熟度本身就是一种隐性风险评估指标。

适合用在哪:场景对照

场景 适配理由 注意事项
手机 / 平板本地助理 2B 体量对内存友好,Day0 覆盖 Arm 平台 复杂多步任务仍需设计兜底逻辑
PC 端侧工具调用 Agentic Index 20 分支撑工具调用与任务规划 单机算力有限,注意并发与延迟
离线隐私场景 本地推理,数据不出设备 知识时效性依赖基座训练语料
嵌入式 / 边缘设备 瑞芯微等平台已适配 需实测量化后的能力衰减

FAQ

1. Agentic Index 20 分”约为同级十倍”该怎么理解?

Agentic Index 衡量的是模型完成 Agent 类任务(工具调用、规划、执行链)的综合表现。官方口径是 20 分约为同级模型的十倍,结合综合 23 分一起看,说明这个模型的分数结构高度偏向 Agent 侧——这正是它的设计目标,而非意外。

2. 2B 模型真的能在手机上跑起来吗?

“能跑”和”跑得好”是两件事。2B 参数加上 Day0 适配保证了前者;后者取决于量化精度、芯片算力和具体任务的复杂度。建议在目标设备上用真实任务做一轮端到端压测,而不是只看榜单分数。

3. UltraData、Meshy、JustRL II 对普通开发者有用吗?

取决于目的。如果只是调用模型,权重足够;如果想复现训练过程或针对垂直场景二次训练,这三件套的价值比权重本身更高——它们提供的是可复现、可验证的路径,而不是黑箱结果。

小结

MiniCPM5-2B 的意义可以概括为一句话:把 Agent 能力从小模型身上”长出来”,而不是从大模型身上”缩下去”。20 分的 Agentic Index 是结果,真正的原因在于 Agentic 预训练加 50 万条 SFT 轨迹的设计取向,以及 Meshy 与 JustRL II 这两件工程武器。对端侧 AI 来说,这类”连训练方法一起开源”的做法,长期看比发一个更好的分数更有价值。

相关阅读

这条线上还有几篇站内文章可以接着看: