2B 的端侧模型,Agent 能力却吊打 12B——面壁这次连训练数据都开源了

2B 的端侧模型,Agent 能力却吊打 12B——面壁这次连训练数据都开源了

平时用 Claude Code、Codex 这些 Agent 干活,模型都在云端,数据要传上去,钱按 Token 烧。本地部署?上百亿参数的模型,普通电脑根本跑不动。就算勉强跑个 10B 以下的端侧模型,大多也只能聊聊天——一旦让它调工具、查资料、执行命令,就掉链子。

直到 9 月 8 日,面壁智能联合 OpenBMB 正式开源了 MiniCPM5-2B。参数只有 2B,手机、电脑都能跑,但它的 Agent 能力,居然能打 4B、9B、12B,甚至 30B 的模型。更狠的是,这次它把训练数据、训练框架一起开源了。

MiniCPM5-2B 官方海报

参数最小,Agent 能力却最强

先看硬数据。在 Artificial Analysis(AA)榜单上,MiniCPM5-2B 以综合得分 23 分,拿下全球 4B 参数以下开源基座模型第一,排在它身后的,是 Gemma 4 12B、Qwen3.5 9B,以及一堆 3B-4B 的主流模型。

AA 榜单:MiniCPM5-2B 4B 以下第一

参数翻倍、翻好几倍的模型,都排在一个 2B 模型后面。这背后是面壁智能一直讲的"密度定律"——大模型的智能密度,大约每 3.5 个月翻一番。

但真正让我眼前一亮的,不是总分,而是 Agent 能力

MiniCPM5-2B 的 Agentic Index 得分高达 20 分,而参数量是它好几倍的 Granite 4.2 8B 只有 9 分,Qwen3.5 9B 只有 7 分。也就是说,一个 2B 的端侧模型,在"会调用工具、会搜索、会写代码"这种多步任务上,比 8B、9B 的模型强了一倍还多。

MiniCPM5-2B 评测对比表 + 雷达图

面壁智能官方整理的综合评测里,MiniCPM5-2B 在代码、数学、长文本、指令遵循、工具调用等 34 项任务中平均分 53.9,位列同级第一,甚至超过了 4B 级里最强的 Qwen3.5-4B。在真实任务评测里,它拿到 891 分(人类基线 1000 分),比参数大 6 倍的 Gemma 4 12B(647 分)更接近人类水平。

为什么一个 2B 模型能这么能打?

关键在于,面壁智能从预训练阶段就开始往模型里灌 Agent 能力。

官方数据披露,MiniCPM5-2B 的训练链路是:200B 规模的 Agent Midtraining(中间训练)→ 百万条高质量轨迹的 Agent SFT(监督微调)→ 可扩展的 Agent RL(强化学习对齐)。整条链路都是围绕"让模型会干活"优化的,而不是先训一个聊天模型再补 Agent 能力。

所以它原生就具备工具调用、深度搜索、代码生成这些 Agent 核心能力,还支持混合思考——同一个模型,既能快问快答,也能切到深度推理模式,按任务情况选。

再加上 512K 超长上下文窗口,单次能处理整本长篇小说或几十万行代码。聊天记录、会议纪要、合同这些敏感数据,以后可以直接交给本地模型处理,数据不出设备,离线也能跑,还没有按 Token 计费的那种焦虑。

模型开源不稀奇,训练数据一起开源才稀奇

如果说榜单分数让我意外,那这次的开源力度就是让我震惊了。

大部分开源模型只放模型权重,训练数据和训练配方各家都捂得紧紧的。这次 MiniCPM5-2B 不只开放权重,连训练方法、微调数据、甚至数据治理工具都一起放了出来。

官方这次一口气开源了四个数据集:

  • UltraData-Code:一套分级整理的代码数据,从约 1.9 亿个公开 GitHub 仓库里筛出来,光精选层就有 4000 亿 tokens。
  • UltraData-SFT-Agent-2609:后训练用的核心 Agent 数据,约 50 万条工具调用、搜索、写代码的完整操作轨迹。
  • UltraData-RL-2609:强化学习阶段用的 8 万多道题,每一道答案都能被程序自动核对。
  • UltraX-Preview:约 1000 亿 tokens 精炼过的预训练语料,之前登顶过 Hugging Face 数据集趋势榜第一。

UltraX-Preview 数据集页面

我特意去看了下 UltraX-Preview,每条样本都带三列:原始文本、精炼后的文本,以及中间到底执行了哪些编辑操作。这套数据治理体系叫 UltraData,其中 UltraX 是最新的数据精炼工具,也开源了。

UltraX 数据精炼框架

UltraX 的思路很有意思——不靠人写规则,也不让大模型整篇重写,而是微调一个轻量模型,专门预测"这行删、这行改、这里插一句"这样的编辑动作,再由程序照着执行,每一条编辑都有记录可查。

除了数据,OpenBMB 还把自研的强化学习训练框架 Meshy 一起开源了。它去掉了 RL 训练里的中央控制器,不再依赖 Ray,训练、推理、奖励计算都做成对等的服务,同步、异步、全异步三种模式灵活切换。配套的 JustRL II 强化学习策略,专门解决端侧模型做长思维链强化学习时分数不升反降的问题——用三阶段流水线筛掉噪声数据,再给 GRPO 加一个 Critic,把奖励精确分到每个词元上。

RL + OPD 训练带来的分数提升

生态已经铺开:9 款芯片 Day0 适配

一个端侧模型能不能用起来,芯片适配是关键。MiniCPM5-2B 官方已完成对 AMD、英特尔、联发科、高通等全球主流芯片厂商的适配;联合众智 FlagOS 社区,还完成了 9 款芯片的 Day0 适配,覆盖华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达,并延伸至 ARM 端侧平台。

部署门槛也压得很低。Ollama、LM Studio 上搜模型下载就能跑,还支持 vLLM、SGLang、llama.cpp、MLX 等主流推理框架直接加载。微调这边,LLaMA-Factory、ms-swift、TRL、unsloth、xtuner 各有教程。

部署与微调文档目录

更贴心的是,仓库的 skills/ 目录里还专门提供了部署和微调的 Agent Skill,能装进 Claude Code、Cursor 等工具。你只要说一句"用 vLLM 把 MiniCPM5-2B 跑起来",Agent 就会自动选框架、跑命令,把部署做完。

代价清醒:别把端侧当云端

当然,也得说清楚。MiniCPM5-2B 再能打,跟云端大模型比,差距还是实实在在存在的。2B 的参数规模摆在那,复杂推理、超大上下文、海量知识这些硬能力,不可能真的追平几百 B 的云端旗舰。

它适合的场景是:数据敏感、要离线、要省成本的端侧任务——手机、PC、车机、机器人上的本地 AI 助手。真到了要处理复杂长任务、追求极致效果的时候,云端模型仍然是更好的选择。

另外,官方评测数据里带角标的分数来自 Artificial Analysis,其余是面壁智能内部测试——也就是说,部分成绩是"自测",第三方独立验证还需要时间。这也是所有厂商发布文都存在的确认偏误风险,看的时候心里有个数。

写在最后

这次 MiniCPM5-2B 开源,让我看到了端侧通用 Agent 能力的雏形。对于手机、PC、汽车这些终端厂商和端侧应用开发者,手里多了一个能直接用的底座。

但比起模型权重,我认为更大的价值是它开源的训练数据。模型能训练到多强,很大程度取决于数据怎么治理、训练怎么调,这些一直是各家捂着的核心技术。面壁这次把训练配方、微调数据、数据治理工具一起放出来,等于把"怎么做出一道好菜"的菜谱也给了你,而不只是端上一盘成品。

这种"权重 + 数据 + 框架"全量开源的做法,确实大气。用不了多久,手机、电脑、车机、机器人上,都能跑一个替我们干活的本地 AI。


相关链接:

评论

暂无评论。

登录后可发表评论。