面壁智能与 OpenBMB 开源社区于 2026 年 9 月 8 日联合开源了新模型 MiniCPM5-2B。这是一个参数规模 2B(20 亿参数)的语言基座模型,支持工具调用、深度搜索、代码生成等任务,官方称已初步实现「端侧通用 Agent」的雏形。第三方评测机构 Artificial Analysis 发布的 AA 榜单显示,MiniCPM5-2B 综合能力得分 23 分,在全球 4B 参数规模以下的开源基座模型中综合排名第一;在专门衡量智能体能力的 Agentic Index 指标上,它拿到 20 分,而同级的 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 等模型只有 2 分。
主角是谁:一家做「小模型」的公司与一个开源社区
面壁智能是一家中国 AI 创业公司,核心路线是把大模型做得又小又强,让 AI 能跑在手机、电脑等本地设备上,其代表作是 MiniCPM 系列端侧模型。OpenBMB 是清华大学自然语言处理团队发起的开源社区,长期维护开源模型与工具链。这次双方把模型权重和配套训练工具一并公开,任何开发者都可以免费下载、使用和修改,不需要向任何公司付费。
这里先补充两个基础概念。参数规模可以粗略理解为模型的「脑容量」,参数越多模型通常越聪明,但也越吃算力——像 GPT 级别的大模型参数动辄数千亿,只能跑在大型数据中心里。2B 意味着 20 亿参数,属于小模型,普通手机芯片就能带动。端侧指 AI 直接在用户自己的设备上运行,数据不出本机,不用联网等云端返回,响应更快也更私密。
榜单成绩:多个维度登顶 4B 以下第一
MiniCPM5-2B 的评测成绩集中在三类数字上:
- AA 榜单综合分 23 分:在全球 4B 参数以下的开源基座模型中排名第一。AA 榜单(Artificial Analysis Intelligence Index)是 Artificial Analysis 这家第三方机构发布的综合评测,会定期更新主流模型的横向对比,是行业常用的参考。
- Agentic Index 断层领先:这项指标专门测模型「当智能体」的能力,即能不能自己拆解任务、调用工具、一步步把事情做完。MiniCPM5-2B 得 20 分,而同级的 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 都只有 2 分。
- 34 项基准评测平均 53.9 分:覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务七个方向,平均分排名第一,不仅领先同级 2B 模型的第二名(33.2 分),也超过了 4B 参数模型中表现最好的 Qwen3.5-4B。此外,以人类水平为 1000 分基线,它在真实任务评测中得到 891 分,同样居 4B 以下模型之首。
基准评测可以理解为用一套标准化的考试题去考模型,方便不同模型之间横向比较。
配套开源:让模型变强的训练方法也公开了
与模型一同开源的还有两套训练工具:自研强化学习框架 Meshy,以及基于奖励的强化学习策略 JustRL II(含 UltraData 系列训练数据)。强化学习是一种训练方法:模型完成任务后,系统根据结果好坏给奖励信号,模型据此不断调整自己的行为,类似「答对了加分、答错了修正」的自我迭代。小模型受限于脑容量,很难靠堆数据硬记,靠强化学习在有限规模里把能力「练」出来,正是这次 2B 模型能打赢 4B 对手的关键原因。
为什么值得关注:端侧 AI 走向「自己干活」
MiniCPM5-2B 的意义不只是榜单名次。它验证了一条路线:小参数模型配合强化学习,可以在端侧达到通用 Agent 的雏形。这意味着未来的手机 AI 助手不需要把数据传到云端,就能在本地完成多步骤任务——比如根据你的日程自动订行程、跨应用调用工具办事。对开发者而言,完全开源 + 配套训练框架,意味着可以基于它自由定制自己的端侧智能体,成本远低于调用云端大模型。
总结来说:面壁智能用 2B 参数的小模型,在多项评测中赢过 4B 级对手,并把整套技术开源。「小模型 + 强化学习」让手机上的 AI 从「陪聊」走向「自己干活」,这条路正被越来越多的实测数据验证。