2B 的端侧模型,Agent 能力却吊打 12B——面壁这次连训练数据都开源了
平时用 Claude Code、Codex 这些 Agent 干活,模型都在云端,数据要传上去,钱按 Token 烧。本地部署?上百亿参数的模型,普通电脑根本跑不动。就算勉强跑个 10B 以下的端侧模型,大多也只能聊聊天——一旦让它调工具、查资料、执行命令,就掉链子。
直到 9 月 8 日,面壁智能联合 OpenBMB 正式开源了 MiniCPM5-2B。参数只有 2B,手机、电脑都能跑,但它的 Agent 能力,居然能打 4B、9B、12B,甚至 30B 的模型。更狠的是,这次它把训练数据、训练框架一起开源了。

参数最小,Agent 能力却最强
先看硬数据。在 Artificial Analysis(AA)榜单上,MiniCPM5-2B 以综合得分 23 分,拿下全球 4B 参数以下开源基座模型第一,排在它身后的,是 Gemma 4 12B、Qwen3.5 9B,以及一堆 3B-4B 的主流模型。

参数翻倍、翻好几倍的模型,都排在一个 2B 模型后面。这背后是面壁智能一直讲的"密度定律"——大模型的智能密度,大约每 3.5 个月翻一番。
但真正让我眼前一亮的,不是总分,而是 Agent 能力。
MiniCPM5-2B 的 Agentic Index 得分高达 20 分,而参数量是它好几倍的 Granite 4.2 8B 只有 9 分,Qwen3.5 9B 只有 7 分。也就是说,一个 2B 的端侧模型,在"会调用工具、会搜索、会写代码"这种多步任务上,比 8B、9B 的模型强了一倍还多。

面壁智能官方整理的综合评测里,MiniCPM5-2B 在代码、数学、长文本、指令遵循、工具调用等 34 项任务中平均分 53.9,位列同级第一,甚至超过了 4B 级里最强的 Qwen3.5-4B。在真实任务评测里,它拿到 891 分(人类基线 1000 分),比参数大 6 倍的 Gemma 4 12B(647 分)更接近人类水平。
为什么一个 2B 模型能这么能打?
关键在于,面壁智能从预训练阶段就开始往模型里灌 Agent 能力。
官方数据披露,MiniCPM5-2B 的训练链路是:200B 规模的 Agent Midtraining(中间训练)→ 百万条高质量轨迹的 Agent SFT(监督微调)→ 可扩展的 Agent RL(强化学习对齐)。整条链路都是围绕"让模型会干活"优化的,而不是先训一个聊天模型再补 Agent 能力。
所以它原生就具备工具调用、深度搜索、代码生成这些 Agent 核心能力,还支持混合思考——同一个模型,既能快问快答,也能切到深度推理模式,按任务情况选。
再加上 512K 超长上下文窗口,单次能处理整本长篇小说或几十万行代码。聊天记录、会议纪要、合同这些敏感数据,以后可以直接交给本地模型处理,数据不出设备,离线也能跑,还没有按 Token 计费的那种焦虑。
模型开源不稀奇,训练数据一起开源才稀奇
如果说榜单分数让我意外,那这次的开源力度就是让我震惊了。
大部分开源模型只放模型权重,训练数据和训练配方各家都捂得紧紧的。这次 MiniCPM5-2B 不只开放权重,连训练方法、微调数据、甚至数据治理工具都一起放了出来。
官方这次一口气开源了四个数据集:
- UltraData-Code:一套分级整理的代码数据,从约 1.9 亿个公开 GitHub 仓库里筛出来,光精选层就有 4000 亿 tokens。
- UltraData-SFT-Agent-2609:后训练用的核心 Agent 数据,约 50 万条工具调用、搜索、写代码的完整操作轨迹。
- UltraData-RL-2609:强化学习阶段用的 8 万多道题,每一道答案都能被程序自动核对。
- UltraX-Preview:约 1000 亿 tokens 精炼过的预训练语料,之前登顶过 Hugging Face 数据集趋势榜第一。

我特意去看了下 UltraX-Preview,每条样本都带三列:原始文本、精炼后的文本,以及中间到底执行了哪些编辑操作。这套数据治理体系叫 UltraData,其中 UltraX 是最新的数据精炼工具,也开源了。

UltraX 的思路很有意思——不靠人写规则,也不让大模型整篇重写,而是微调一个轻量模型,专门预测"这行删、这行改、这里插一句"这样的编辑动作,再由程序照着执行,每一条编辑都有记录可查。
除了数据,OpenBMB 还把自研的强化学习训练框架 Meshy 一起开源了。它去掉了 RL 训练里的中央控制器,不再依赖 Ray,训练、推理、奖励计算都做成对等的服务,同步、异步、全异步三种模式灵活切换。配套的 JustRL II 强化学习策略,专门解决端侧模型做长思维链强化学习时分数不升反降的问题——用三阶段流水线筛掉噪声数据,再给 GRPO 加一个 Critic,把奖励精确分到每个词元上。

生态已经铺开:9 款芯片 Day0 适配
一个端侧模型能不能用起来,芯片适配是关键。MiniCPM5-2B 官方已完成对 AMD、英特尔、联发科、高通等全球主流芯片厂商的适配;联合众智 FlagOS 社区,还完成了 9 款芯片的 Day0 适配,覆盖华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达,并延伸至 ARM 端侧平台。
部署门槛也压得很低。Ollama、LM Studio 上搜模型下载就能跑,还支持 vLLM、SGLang、llama.cpp、MLX 等主流推理框架直接加载。微调这边,LLaMA-Factory、ms-swift、TRL、unsloth、xtuner 各有教程。

更贴心的是,仓库的 skills/ 目录里还专门提供了部署和微调的 Agent Skill,能装进 Claude Code、Cursor 等工具。你只要说一句"用 vLLM 把 MiniCPM5-2B 跑起来",Agent 就会自动选框架、跑命令,把部署做完。
代价清醒:别把端侧当云端
当然,也得说清楚。MiniCPM5-2B 再能打,跟云端大模型比,差距还是实实在在存在的。2B 的参数规模摆在那,复杂推理、超大上下文、海量知识这些硬能力,不可能真的追平几百 B 的云端旗舰。
它适合的场景是:数据敏感、要离线、要省成本的端侧任务——手机、PC、车机、机器人上的本地 AI 助手。真到了要处理复杂长任务、追求极致效果的时候,云端模型仍然是更好的选择。
另外,官方评测数据里带角标的分数来自 Artificial Analysis,其余是面壁智能内部测试——也就是说,部分成绩是"自测",第三方独立验证还需要时间。这也是所有厂商发布文都存在的确认偏误风险,看的时候心里有个数。
写在最后
这次 MiniCPM5-2B 开源,让我看到了端侧通用 Agent 能力的雏形。对于手机、PC、汽车这些终端厂商和端侧应用开发者,手里多了一个能直接用的底座。
但比起模型权重,我认为更大的价值是它开源的训练数据。模型能训练到多强,很大程度取决于数据怎么治理、训练怎么调,这些一直是各家捂着的核心技术。面壁这次把训练配方、微调数据、数据治理工具一起放出来,等于把"怎么做出一道好菜"的菜谱也给了你,而不只是端上一盘成品。
这种"权重 + 数据 + 框架"全量开源的做法,确实大气。用不了多久,手机、电脑、车机、机器人上,都能跑一个替我们干活的本地 AI。
相关链接:
- MiniCPM5 开源合集(含模型与 UltraData 系列数据):https://huggingface.co/collections/openbmb/minicpm5
- MiniCPM GitHub 仓库:https://github.com/OpenBMB/MiniCPM
- Meshy 强化学习框架:https://github.com/OpenBMB/Meshy
- UltraData 数据治理体系:https://ultradata.openbmb.cn/
- MiniCPM5-2B 在线 Demo:https://huggingface.co/spaces/openbmb/MiniCPM5-2B-Demo
暂无评论。