本地跑 Agent 不再按 token 计费——Liquid AI 把这句话变成了一个 2.6B 的模型。
8月4日,Liquid AI 发布 LFM2.5-2.6B:一个为 Agent 工作流训练的端侧模型,发布当天就在 HuggingFace 开放下载,GGUF、MLX、vLLM、SGLang、ONNX 五种推理路径全部可用。
截至我核验时,HuggingFace 下载量已经 73,573 次、306 个 like——发布两天,社区捡得很快。
一、2.6B 能干 Agent 的活?
模型 2.6B 参数、约 34T token 预训练,词表就地翻倍到 128K(增强中文等非拉丁语言支持),128K 上下文。
官方自测数据:
| 场景 | 数据 |
|---|---|
| M5 Max 本地推理 | 220 tok/s |
| Ryzen AI Max+ 395 | 113 tok/s |
| 内存占用 | < 2.5GB |
| 手机端 | 30 tok/s |
| 单张 H100 高并发(SGLang) | 接近 15K output token/s(约一天 13 亿 token) |
官方称指令遵循和几乎所有工具使用基准领先(仅 BFCLv4 落后 Qwen3.5-9B),Agent 任务全面超过两款 Gemma。但注意:全是官方自测,没有第三方复现。
编程是官方承认的短板:LiveCodeBench v6 上 59.41,对 Qwen3.5-9B 的 69.86。
二、为什么它是"为 Agent 训练"而不是"为聊天微调"
机制重点不在架构,在后训练管线,四步:
- 两轮 SFT 打底,加重工具使用、网页搜索、软件工程和 Agent 轨迹的比重
- 六个专家教师从同一检查点分支:指令遵循、数学、知识、代码、工具、长上下文各自精调
- MOPD 蒸馏:学生在自己策略下 rollout,每个 prompt 由对应领域教师做 token 级反馈,压回一个 2.6B 学生——避免普通蒸馏的分布偏移
- Agentic RL(GRPO):在真实 Agent harness 的沙盒里跑多步任务,奖励结合评审模型、程序化检查和安全门
关键结论:工具调用能力不是提示词工程堆出来的,是在真实 Agent 环境里强化学习出来的。 Agentic RL 是在 OpenClaw、Hermes Agent 等特定 harness 里训练的。
三、对真实工作流的影响
成本结构变化。 你在跑任何按 token 计费的云端 Agent——夜间批量处理工单、扫库写周报、监控告警分诊——任务越多账单越厚。LFM2.5-2.6B 让模型在笔记本上常驻,本地推理边际成本为零,Agent 可以 7×24 小时并行跑后台任务。
接入两步。 用 llama.cpp / MLX / vLLM 架成 OpenAI 兼容端点,把现有 Agent harness 指过去——官方称 Hermes Agent、OpenClaw、Pi 开箱即用。
国内现实意义。 数据不出设备,隐私合规压力消失;离线可用,网络波动不影响服务。
四、GitHub 视角:官方没放代码,社区已经动了
值得注意:Liquid AI 官方 GitHub 组织下没有 LFM2.5-2.6B 的仓库——模型权重在 HuggingFace,官方没有开源推理代码。但社区生态已经开始生长(发布两天内):
- nico-martin/LFM2.5-2.6B-WebGPU(17★):纯浏览器研究 agent,Transformers.js + WebGPU,模型直接在浏览器里跑——HuggingFace Spaces 上能直接玩
- bebelm(64★):纯 Rust 实现的 LFM2.5-8B-A1B CPU 推理(LFM2.5 系列)
- Tiny-MoA(38★):LFM2.5 Brain (1.2B) + Falcon-R 在 CPU 上跑 Mixture of Agents
- LFM2.5-1.2B-Instruct-mobile-actions(29★):移动端动作微调
- LFM2.5-2.6B-WebGPU 的 README 极简——"A browser-only research agent",社区项目普遍还是脚手架阶段
**"官方开源权重、社区补推理栈"**是 LFM2.5 系列的典型模式:模型 8B-A1B、2.6B、1.2B 多尺寸齐全,但官方仓库专注文档和模型卡,工程化实现主要靠 llama.cpp/MLX 等生态和社区项目。
五、许可证:不是标准开源
LFM Open License v1.0——权重可自由下载、微调、部署,但第 5 条:年营收达到或超过 1000 万美元的实体,商用不在授权范围内。个人、小团队、非营利研究不受限。
对成长中的团队,这是一个要提前记账的变量:营收过了线,商用授权就得单独谈。
六、代价清醒
- 基准未经第三方复现——官方数字当假设,不当结论
- 编程明显弱于 9B 级——代码生成主力别指望它接班
- 128K 长上下文极端窗口表现未验证
- Agentic RL 在特定 harness 训练——自建框架兼容性要自己验证
- 许可证门槛:年营收 1000 万美元以上商用要谈授权
七、结论
LFM2.5-2.6B 的意义:**"本地 Agent"路线今年第一次有模型把工具调用、多步规划和端侧速度同时做到可用水位。**
今天就能干的事:下载 GGUF/MLX 版,架成 OpenAI 兼容端点,挑一条真实多步任务接进自己的 Agent harness 对比一下。生产环境先让子弹飞一两周——等第三方复现。
本地跑 Agent 不再按 token 计费,这个方向,比任何一个 benchmark 数字都重要。
相关链接:
- HuggingFace:https://huggingface.co/LiquidAI/LFM2.5-2.6B
- 官方博客(Deploy Agents Everywhere):https://www.liquid.ai/blog/
- WebGPU 浏览器 demo:https://huggingface.co/spaces/LiquidAI/LFM2.5-2.6B-WebGPU
- 社区 WebGPU 仓库:https://github.com/nico-martin/LFM2.5-2.6B-WebGPU
- IT之家报道:https://www.ithome.com/
暂无评论。