2.6B 端侧 Agent 模型发布即开源:本地跑 Agent 不再按 token 计费

本地跑 Agent 不再按 token 计费——Liquid AI 把这句话变成了一个 2.6B 的模型。

8月4日,Liquid AI 发布 LFM2.5-2.6B:一个为 Agent 工作流训练的端侧模型,发布当天就在 HuggingFace 开放下载,GGUF、MLX、vLLM、SGLang、ONNX 五种推理路径全部可用。

截至我核验时,HuggingFace 下载量已经 73,573 次、306 个 like——发布两天,社区捡得很快。

一、2.6B 能干 Agent 的活?

模型 2.6B 参数、约 34T token 预训练,词表就地翻倍到 128K(增强中文等非拉丁语言支持),128K 上下文。

官方自测数据:

场景 数据
M5 Max 本地推理 220 tok/s
Ryzen AI Max+ 395 113 tok/s
内存占用 < 2.5GB
手机端 30 tok/s
单张 H100 高并发(SGLang) 接近 15K output token/s(约一天 13 亿 token)

官方称指令遵循和几乎所有工具使用基准领先(仅 BFCLv4 落后 Qwen3.5-9B),Agent 任务全面超过两款 Gemma。但注意:全是官方自测,没有第三方复现。

编程是官方承认的短板:LiveCodeBench v6 上 59.41,对 Qwen3.5-9B 的 69.86。

二、为什么它是"为 Agent 训练"而不是"为聊天微调"

机制重点不在架构,在后训练管线,四步:

  1. 两轮 SFT 打底,加重工具使用、网页搜索、软件工程和 Agent 轨迹的比重
  2. 六个专家教师从同一检查点分支:指令遵循、数学、知识、代码、工具、长上下文各自精调
  3. MOPD 蒸馏:学生在自己策略下 rollout,每个 prompt 由对应领域教师做 token 级反馈,压回一个 2.6B 学生——避免普通蒸馏的分布偏移
  4. Agentic RL(GRPO):在真实 Agent harness 的沙盒里跑多步任务,奖励结合评审模型、程序化检查和安全门

关键结论:工具调用能力不是提示词工程堆出来的,是在真实 Agent 环境里强化学习出来的。 Agentic RL 是在 OpenClaw、Hermes Agent 等特定 harness 里训练的。

三、对真实工作流的影响

成本结构变化。 你在跑任何按 token 计费的云端 Agent——夜间批量处理工单、扫库写周报、监控告警分诊——任务越多账单越厚。LFM2.5-2.6B 让模型在笔记本上常驻,本地推理边际成本为零,Agent 可以 7×24 小时并行跑后台任务。

接入两步。 用 llama.cpp / MLX / vLLM 架成 OpenAI 兼容端点,把现有 Agent harness 指过去——官方称 Hermes Agent、OpenClaw、Pi 开箱即用。

国内现实意义。 数据不出设备,隐私合规压力消失;离线可用,网络波动不影响服务。

四、GitHub 视角:官方没放代码,社区已经动了

值得注意:Liquid AI 官方 GitHub 组织下没有 LFM2.5-2.6B 的仓库——模型权重在 HuggingFace,官方没有开源推理代码。但社区生态已经开始生长(发布两天内):

  • nico-martin/LFM2.5-2.6B-WebGPU(17★):纯浏览器研究 agent,Transformers.js + WebGPU,模型直接在浏览器里跑——HuggingFace Spaces 上能直接玩
  • bebelm(64★):纯 Rust 实现的 LFM2.5-8B-A1B CPU 推理(LFM2.5 系列)
  • Tiny-MoA(38★):LFM2.5 Brain (1.2B) + Falcon-R 在 CPU 上跑 Mixture of Agents
  • LFM2.5-1.2B-Instruct-mobile-actions(29★):移动端动作微调
  • LFM2.5-2.6B-WebGPU 的 README 极简——"A browser-only research agent",社区项目普遍还是脚手架阶段

**"官方开源权重、社区补推理栈"**是 LFM2.5 系列的典型模式:模型 8B-A1B、2.6B、1.2B 多尺寸齐全,但官方仓库专注文档和模型卡,工程化实现主要靠 llama.cpp/MLX 等生态和社区项目。

五、许可证:不是标准开源

LFM Open License v1.0——权重可自由下载、微调、部署,但第 5 条:年营收达到或超过 1000 万美元的实体,商用不在授权范围内。个人、小团队、非营利研究不受限。

对成长中的团队,这是一个要提前记账的变量:营收过了线,商用授权就得单独谈。

六、代价清醒

  • 基准未经第三方复现——官方数字当假设,不当结论
  • 编程明显弱于 9B 级——代码生成主力别指望它接班
  • 128K 长上下文极端窗口表现未验证
  • Agentic RL 在特定 harness 训练——自建框架兼容性要自己验证
  • 许可证门槛:年营收 1000 万美元以上商用要谈授权

七、结论

LFM2.5-2.6B 的意义:**"本地 Agent"路线今年第一次有模型把工具调用、多步规划和端侧速度同时做到可用水位。**

今天就能干的事:下载 GGUF/MLX 版,架成 OpenAI 兼容端点,挑一条真实多步任务接进自己的 Agent harness 对比一下。生产环境先让子弹飞一两周——等第三方复现。

本地跑 Agent 不再按 token 计费,这个方向,比任何一个 benchmark 数字都重要。


相关链接:

评论

暂无评论。

登录后可发表评论。