2B「小钢炮」登顶:MiniCPM5-2B 全盘开源,把数据管线摆上台面
2B 端侧模型登顶 4B 以下开源榜首,Agent 能力断层领先,并罕见开源全套数据与 RL 管线。

综述
9 月 8 日,面壁智能与 OpenBMB 开源新一代端侧「小钢炮」MiniCPM5-2B。在国际基准 Artificial Analysis Intelligence Index(AA 榜单)上,这个 2B 参数模型拿到综合 23 分,成为全球 4B 参数以下得分最高的开源基座模型——作为参照,参数量是它数倍的 Qwen3.5-9B 与 Gemma 4-12B 均为 22 分。
更突出的是智能体能力:在专门评测 Agent 能力的 Agentic Index 上,MiniCPM5-2B 拿到 20 分,第二名 Granite4.2-8B 只有 9 分,同级的 2B-4B 模型普遍仅 2 分,业界常用对照 gpt-oss-20b 为 3 分。输出效率同样亮眼:平均输出 21k token,全场最低,而 Qwen3.5-9B 需要约 34k。
与「只放权重」的常见开源不同,这次一并开源了训练 Recipe、RL 框架 Meshy、四个数据集与 JustRL II 算法——把「怎么练出来的」整体交了出来。
专业分析
MiniCPM5-2B 的成绩逻辑,与面壁智能长期主张的「密度定律」一致:在固定成本(参数/算力)下逼近能力上限,靠数据与训练方法的密度取胜,而不是靠堆参数。
值得拆开看的是三块技术含量最高的部分。
JustRL II:给 GRPO 装 Critic。 GRPO 这类纯策略梯度方法去掉 Critic 模型换来省显存,但也放弃了词元级的细粒度信用分配——模型只知道整段回答好坏,不知道好/坏具体落在哪个 token。JustRL II 的思路是把 Critic 请回来做词元级信用分配,让小模型也能从长程推理信号里学到「哪一步想错了」。这与「小模型需要更密的训练信号」的需求是自洽的。
Meshy RL 框架:去中心化、去 Ray 依赖。 开源社区用 RL 训练小模型的隐性门槛,往往不是算法而是工程——Ray 集群的搭建与运维劝退了大批研究者。Meshy 提供同步、异步、全异步三种模式且不依赖 Ray,等于把「小团队也能跑 RL」的工程门槛降了一截。
数据治理进入「分级治理」时代。 UltraData-Code 对 1.92 亿仓库做 L0-L3 分级,产出 400B+150B token;UltraData-RL-2609 用三阶段清洗处理「答案不可验证」这个 RL 数据的老痛点。数据侧投入的密度,可能才是榜单数字背后的真正解释变量——面壁智能累计开源 10+ 训练数据集,下载量 266 万+。
榜单口径说明:AA Index 为第三方机构基准,Agentic 分数反映的是其设定任务下的表现;厂商引用口径与真实业务 Agent 效果之间仍需独立复测。
关联信息与影响
这条新闻与近期几条线索互相咬合:算力红利见顶后,行业对「更大不等于更好」的共识在增强;端侧 Agent 方向开始有真正的模型层支撑(此前多靠云端模型蒸馏或压缩);「开源 = 权重」的旧定义正在被改写——数据管线与训练配方开始成为开源叙事的主角。MiniCPM 系列累计下载量已超 5000 万,说明端侧小模型不是实验室玩具,而是有真实装机量的产品线。
未来展望
短期看,2B 这个尺寸会先吃掉一批「本地优先」场景:离线助手、隐私敏感终端、低成本 Agent 后台。中期,若 Meshy 与数据集的组合真能降低 RL 复现门槛,可能出现一批基于同一配方生态的衍生小模型,类似当年 LLaMA 权重生态的扩散。需要泼冷水的是:Agentic 榜单分数与真实多步任务稳定性之间还有距离,端侧 Agent 的可靠性、工具调用闭环、跨 App 权限问题都不是模型单点能解决的。MiniCPM5-2B 证明「小」可以「强」,但还没证明「小」可以独立撑起通用 Agent。
信号强度
- 大模型厂商:密度定律的示范效应会把军备竞赛引向数据与训练效率;纯堆参数的叙事需要重新校准。
- 研究者:Recipe + 数据集 + RL 框架全开源,是少有的「可复现 RL 训练」完整样本,适合作为小模型训练方法的基线研究。
- 开发者:端侧推理生态(llama.cpp/Ollama/vLLM/SGLang)均已适配;本地部署 2B 级 Agent 的硬件门槛进一步降低。
- 内容创作者:本地小模型的低成本化,会让「私有知识 + 本地生成」的内容工具更易落地,但输出质量仍需人工把关。
- 产业链成员:端侧芯片与整机厂商可能受益于小模型 Agent 的本地化需求;数据标注与数据治理服务的价值被重新定价——数据管线成了新的护城河叙事。
实际测试:本机 Ollama 上的 MiniCPM 小考
文章成稿前,用 Pi 驱动本机 Ollama 里跑的 MiniCPM5-2B 做了一次工具调用小考——4 题全对,工具选择 100%:
| 考题 | 期望工具 | 实际调用 | 参数 |
|---|---|---|---|
| 上海明天天气 | get_weather | ✓ | {"city":"Shanghai","date":"明天"} |
| 23 乘以 47 | calculate | ✓ | {"expression":"23 * 47"} |
| 下午三点提醒回电话 | set_reminder | ✓ | {"time":"15:00","text":"call client"} |
| 搜面壁 MiniCPM 新闻 | search_web | ✓ | {"query":"latest updates on Face壁智能 MiniCPM"} |
结论:工具选得又准又稳,「小钢炮」干活这块没虚标。但也暴露一个 2B 的典型小毛病——中文参数会被悄悄翻成英文(Shanghai、call client,甚至出现"Face壁智能"这种中英杂交)。理解中文指令没问题,提取参数时却倾向往英文漂。真要在中文工具链里用,在 system 提示里加一句"参数必须保持用户原文语言"就能治。
顺带问清了跑 2B 的服务器配置(2B Q4 量化约 1.6GB):
| 档位 | 配置 | 速度体感 | 参考价(云) |
|---|---|---|---|
| 勉强 | 2 核 / 4G | 加载得了,答一句等半分钟 | 轻量服务器几十/月 |
| 舒服 | 4 核 / 8G | 10~20 tok/s,聊天不煎熬 | 百元级/月 |
| 流畅 | 8 核 / 16G | 30+ tok/s(≈笔记本电脑) | 两三百/月 |
| 碾压 | 任意 6G+ 显存 GPU | 100+ tok/s,还能再带个大模型 | T4 按量,几块/小时 |
核心算法:没 GPU 就靠 CPU 核数堆速度(家用笔记本 16 核实测约 30 tok/s);内存底线是模型大小 ×2 + 2G(2B 至少要 6G 内存才从容)。轻量应用服务器(2核/3.4G)正好卡在"勉强"以下一格。实际建议:别为 2B 买服务器——它轻到本机随便跑,云端跑 2B 是拿大炮打蚊子;真需要云端常驻,从 4 核/8G 起步,或者等有跑 7B+ 的需求再上 GPU。
信息局限说明:本文榜单与数字依据情报库收录的新智元报道与官方资料,厂商引用的基准口径未经独立复测,MiniCPM5-2B 的真实端侧表现仍建议以自测为准。
面壁智能/OpenBMB 开源 MiniCPM5-2B:AA 综合 23 分登顶 4B 以下开源第一,Agentic 20 分断层领先
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

