树莓派都能跑的"思考模型"?1.2B 参数吊打 1.7B 的 Qwen,代价你得知道
你的手机助手为什么总是"钝"?不是它笨,是你根本请不动一个会思考的模型——云端按 token 计费,本地跑不动推理。
Liquid AI 刚发布的 LFM2.5 家族,就是冲着这个问题来的:1.2B 参数的推理模型,内存占用不到 900MB,在 MATH-500 上从 63 分干到 88 分。
先说反差:最小的模型,干翻了四倍大的对手
LFM2.5 家族一共四个主力:1.2B-Thinking(推理)、2.6B(旗舰)、8B-A1B(MoE)、VL-3B(视觉)。
最狠的数据在 2.6B 身上。官方对比 Google Gemma 4 E2B/E4B 和阿里 Qwen3.5-4B/9B,这个全场最小的模型拿下了几乎所有的指令遵循基准第一(IFBench、Multi-IF、IFStruct),工具使用 ToolSandbox 拿 77.83 分——只比 9.7B 的 Qwen3.5-9B 的 BFCLv4 差一项。
1.2B-Thinking 更夸张:官方测试里与 Qwen3-1.7B thinking 模式打成平手甚至反超(GPQA Diamond、GSM8K、MATH-500、BFCLv3),但参数少了 40%,内存占用不到 1GB。Deeplearning.ai 的评价是"以不到 900MB 的内存运行,速度和效率 exceptional"。
速度数据同样顶:2.6B 在单张 H100 上持续并发负载跑到近 1.5 万 output tokens/秒,约一天 13 亿 token;8B-A1B MoE 拿下同尺寸级最快,18.5K tokens/秒,单卡一天 16 亿 token。
凭什么?混合架构:注意力 + 卷积
LFM2.5 不是标准 Transformer。它把自注意力层和卷积层混着用——注意力负责长程依赖,卷积负责局部模式提取,后者计算量小得多。这就是 1B 级模型能塞进手机内存、还能"思考"的架构底子。
对端侧部署来说,这个设计直击要害:推理模型最大的痛点是 thinking 模式输出 token 翻倍,延迟敏感的设备根本扛不住。LFM2.5-1.2B-Thinking 在性能持平的同时输出 token 更少——边缘场景里每个 token 都是延迟。
生态:Ollama 直接拉
这是家族最实际的部分。发布即全格式覆盖:Transformers、GGUF(llama.cpp)、MLX(苹果芯片)、ONNX,支持 Ollama、LM Studio、vLLM、NexaSDK、FastFlowML、Cactus Compute,硬件横跨 Apple、AMD、Qualcomm、Nvidia——高通 NPU 和 AMD Ryzen NPU 都有专门优化运行时。
也就是说:ollama pull lfm2.5-thinking:1.2b,731MB,下载完就能在你现在的机器上跑。Ollama 上已有 130 万次下载。
代价清醒:官方数字没吹,但有三件事你得知道
一、不是所有基准都赢。 1.2B-Thinking 在 MMLU-Pro 和 AIME 2025 上输给了 Qwen3-1.7B——知识广度和竞赛级数学仍是短板。1B 级模型的"思考"是流程性推理强,硬知识还是薄。
二、数字全部来自厂商自测。 VentureBeat 明确标注"these figures are vendor benchmarks and have not been independently verified"。榜单对比的竞品名单也是官方选的。
三、社区实测翻过车。 Reddit r/LocalLLaMA 有用户拿 LFM2.5-VL-1.6B 做 OCR 实测,BF16 下"有时会混淆字母和数字"——不要指望它做精确字符捕获。这正是小模型的经典静默失败:看着对,实际错,错误沿着调用链传播无人发现。
该怎么选
- 手机/树莓派/无 GPU 设备跑 Agent:LFM2.5-2.6B 就是为这个场景造的,指令遵循和工具调用是同级最优
- 本地推理模型的最低门槛:1.2B-Thinking,900MB 内存,MATH-500 88 分
- 并发吞吐:8B-A1B MoE,单卡一天 16 亿 token
- 想拿它做 OCR 精确提取:先看社区实测,字符级任务需谨慎
- 竞赛数学、知识问答:还是用大模型,1B 级不适合
边缘 AI 的竞争维度变了:有人在云端拼参数,有人把"会思考"塞进 900MB。LFM2.5 是后者目前最完整的一份答卷——答卷是官方写的,但至少 Ollama 上 130 万次下载说明,真跑过的人不在少数。
相关链接:
- Liquid AI 官网:https://www.liquid.ai
- LFM2.5-1.2B-Thinking 博客:https://www.liquid.ai/blog/lfm2-5-1-2b-thinking-on-device-reasoning-under-1gb
- LFM2.5-8B-A1B 博客:https://www.liquid.ai/blog/lfm2-5-8b-a1b
- LFM2.5-VL-3B 博客:https://www.liquid.ai/blog/lfm2-5-vl-3b
- HuggingFace 模型页:https://huggingface.co/LiquidAI/LFM2.5-1.2B-Thinking
- Ollama:https://ollama.com/library/lfm2.5-thinking:1.2b
暂无评论。