深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

2B「小钢炮」登顶:MiniCPM5-2B 全盘开源,把数据管线摆上台面

2026-09-08·新智元·模型推理端侧模型小钢炮开源权重RL训练数据管线密度定律
▮ SIGNAL SUMMARY · 摘要快读

2B 端侧模型登顶 4B 以下开源榜首,Agent 能力断层领先,并罕见开源全套数据与 RL 管线。

2B「小钢炮」登顶:MiniCPM5-2B 全盘开源,把数据管线摆上台面

综述

9 月 8 日,面壁智能与 OpenBMB 开源新一代端侧「小钢炮」MiniCPM5-2B。在国际基准 Artificial Analysis Intelligence Index(AA 榜单)上,这个 2B 参数模型拿到综合 23 分,成为全球 4B 参数以下得分最高的开源基座模型——作为参照,参数量是它数倍的 Qwen3.5-9B 与 Gemma 4-12B 均为 22 分。

更突出的是智能体能力:在专门评测 Agent 能力的 Agentic Index 上,MiniCPM5-2B 拿到 20 分,第二名 Granite4.2-8B 只有 9 分,同级的 2B-4B 模型普遍仅 2 分,业界常用对照 gpt-oss-20b 为 3 分。输出效率同样亮眼:平均输出 21k token,全场最低,而 Qwen3.5-9B 需要约 34k。

与「只放权重」的常见开源不同,这次一并开源了训练 Recipe、RL 框架 Meshy、四个数据集与 JustRL II 算法——把「怎么练出来的」整体交了出来。

专业分析

MiniCPM5-2B 的成绩逻辑,与面壁智能长期主张的「密度定律」一致:在固定成本(参数/算力)下逼近能力上限,靠数据与训练方法的密度取胜,而不是靠堆参数。

值得拆开看的是三块技术含量最高的部分。

JustRL II:给 GRPO 装 Critic。 GRPO 这类纯策略梯度方法去掉 Critic 模型换来省显存,但也放弃了词元级的细粒度信用分配——模型只知道整段回答好坏,不知道好/坏具体落在哪个 token。JustRL II 的思路是把 Critic 请回来做词元级信用分配,让小模型也能从长程推理信号里学到「哪一步想错了」。这与「小模型需要更密的训练信号」的需求是自洽的。

Meshy RL 框架:去中心化、去 Ray 依赖。 开源社区用 RL 训练小模型的隐性门槛,往往不是算法而是工程——Ray 集群的搭建与运维劝退了大批研究者。Meshy 提供同步、异步、全异步三种模式且不依赖 Ray,等于把「小团队也能跑 RL」的工程门槛降了一截。

数据治理进入「分级治理」时代。 UltraData-Code 对 1.92 亿仓库做 L0-L3 分级,产出 400B+150B token;UltraData-RL-2609 用三阶段清洗处理「答案不可验证」这个 RL 数据的老痛点。数据侧投入的密度,可能才是榜单数字背后的真正解释变量——面壁智能累计开源 10+ 训练数据集,下载量 266 万+。

榜单口径说明:AA Index 为第三方机构基准,Agentic 分数反映的是其设定任务下的表现;厂商引用口径与真实业务 Agent 效果之间仍需独立复测。

关联信息与影响

这条新闻与近期几条线索互相咬合:算力红利见顶后,行业对「更大不等于更好」的共识在增强;端侧 Agent 方向开始有真正的模型层支撑(此前多靠云端模型蒸馏或压缩);「开源 = 权重」的旧定义正在被改写——数据管线与训练配方开始成为开源叙事的主角。MiniCPM 系列累计下载量已超 5000 万,说明端侧小模型不是实验室玩具,而是有真实装机量的产品线。

未来展望

短期看,2B 这个尺寸会先吃掉一批「本地优先」场景:离线助手、隐私敏感终端、低成本 Agent 后台。中期,若 Meshy 与数据集的组合真能降低 RL 复现门槛,可能出现一批基于同一配方生态的衍生小模型,类似当年 LLaMA 权重生态的扩散。需要泼冷水的是:Agentic 榜单分数与真实多步任务稳定性之间还有距离,端侧 Agent 的可靠性、工具调用闭环、跨 App 权限问题都不是模型单点能解决的。MiniCPM5-2B 证明「小」可以「强」,但还没证明「小」可以独立撑起通用 Agent。

信号强度

实际测试:本机 Ollama 上的 MiniCPM 小考

文章成稿前,用 Pi 驱动本机 Ollama 里跑的 MiniCPM5-2B 做了一次工具调用小考——4 题全对,工具选择 100%:

考题期望工具实际调用参数
上海明天天气get_weather{"city":"Shanghai","date":"明天"}
23 乘以 47calculate{"expression":"23 * 47"}
下午三点提醒回电话set_reminder{"time":"15:00","text":"call client"}
搜面壁 MiniCPM 新闻search_web{"query":"latest updates on Face壁智能 MiniCPM"}

结论:工具选得又准又稳,「小钢炮」干活这块没虚标。但也暴露一个 2B 的典型小毛病——中文参数会被悄悄翻成英文(Shanghai、call client,甚至出现"Face壁智能"这种中英杂交)。理解中文指令没问题,提取参数时却倾向往英文漂。真要在中文工具链里用,在 system 提示里加一句"参数必须保持用户原文语言"就能治。

顺带问清了跑 2B 的服务器配置(2B Q4 量化约 1.6GB):

档位配置速度体感参考价(云)
勉强2 核 / 4G加载得了,答一句等半分钟轻量服务器几十/月
舒服4 核 / 8G10~20 tok/s,聊天不煎熬百元级/月
流畅8 核 / 16G30+ tok/s(≈笔记本电脑)两三百/月
碾压任意 6G+ 显存 GPU100+ tok/s,还能再带个大模型T4 按量,几块/小时

核心算法:没 GPU 就靠 CPU 核数堆速度(家用笔记本 16 核实测约 30 tok/s);内存底线是模型大小 ×2 + 2G(2B 至少要 6G 内存才从容)。轻量应用服务器(2核/3.4G)正好卡在"勉强"以下一格。实际建议:别为 2B 买服务器——它轻到本机随便跑,云端跑 2B 是拿大炮打蚊子;真需要云端常驻,从 4 核/8G 起步,或者等有跑 7B+ 的需求再上 GPU。

信息局限说明:本文榜单与数字依据情报库收录的新智元报道与官方资料,厂商引用的基准口径未经独立复测,MiniCPM5-2B 的真实端侧表现仍建议以自测为准。

SIGNAL FILE · 情报档案

面壁智能/OpenBMB 开源 MiniCPM5-2B:AA 综合 23 分登顶 4B 以下开源第一,Agentic 20 分断层领先

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://mp.weixin.qq.com/s/wJORxWInN5cU9dW300h4ww(新智元)

RELATED SIGNALS · 关联信号