四个国产模型组队,干翻了旗舰?OpenSquilla 6512星

如果有人说「四个便宜模型组队,能打赢一个旗舰模型」,你会觉得他在吹牛。

OpenSquilla 就是这么干的,而且把测试数据公开了:4 个国产模型并行提案 + 1 个模型聚合综合,在 100 道高难度任务上,质量分超过 Opus 4.8 和 GPT-5.5,成本只有零头。项目目前在 GitHub 6512 星。

一、先看数据

源文章(基元律动,OpenSquilla 官方公众号)公布了 DRACO 全量测试集(100 个高难度任务)的对比:

对比对象 质量提升 成本变化
vs Fable5 +1.05 -67.77%
vs Opus 4.8 +8.59 -40.00%
vs GPT-5.5 +10.84 -13.00%

阵容:DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7 四个国产模型当「前锋」,各自独立搜索、推理、提方案;第 5 个模型(GLM-5.2)当「队长」聚合四个候选,融合出最优结果。没有一个国外旗舰模型。

GitHub README 里还有一组更直观的数据(PinchBench 1.2.1,25 个任务):

Agent 基座模型 平均分 总成本
OpenSquilla 路由(Opus4.7+GLM5.1+DS4 Flash) 0.9251 $0.688
OpenClaw Claude Opus 4.7 0.9255 $6.233

分数几乎打平(0.9251 vs 0.9255),成本差了 9 倍。这就是「同样的预算,让 Agent 做更多事」。

二、为什么多模型组队能赢

单个模型有三个老毛病:

  • 一个人查资料,容易漏关键信息源
  • 一个人算数,没人帮着对,容易算错
  • 一个人干活,约束条件一多就丢三落四

四个模型从不同角度覆盖、互相补位,本质是用多样性采样 + 共识聚合把单模型的短板垫平。

源文章给了几个具体案例,比如让 AI 对比澳洲热泵烘干机,Fable5 漏了三款机型的容量,OpenSquilla 完整覆盖型号、容量、保修、能耗、澳洲场景适配和 TCO 计算逻辑——多模型交叉验证后,漏信息的概率明显更低。

三、背后是 Harness 层,不是模型

OpenSquilla 的核心观点:Agent = Models + Agent Harness

模型负责「智能」,Harness(包裹在模型外围的可执行代码)负责「组织」——决定存储什么、检索什么、向模型呈现什么、多个模型怎么协作。当各家基础模型的能力差距逐渐缩小,决定 AI 产品质量的分水岭已经从「模型本身」转移到了「怎么驾驭模型」。

OpenSquilla 做的就是 Harness。不卷模型,卷组织方式。

四、GitHub 上的干货(源文章没讲的)

SquillaRouter:本地 LightGBM + ONNX 分类器,按长度、语言、代码、关键词和语义嵌入给每一轮打分,分派到 C0–C3 四个分级里能胜任的最便宜模型。分类在本机完成——为了做这个判断,你的提示词不会离开本机

20+ LLM 提供商:TokenRhythm、OpenRouter、OpenAI、Anthropic、Ollama、DeepSeek、Gemini、Qwen/DashScope、Moonshot、Mistral、Groq、智谱、SiliconFlow、vLLM、LM Studio 等,支持主用+回退。

15 个内置技能 + MCP:coding、GitHub、cron、pptx/docx/xlsx/pdf、摘要、tmux、天气等,仅任务需要时加载。OpenSquilla 既是 MCP 客户端,也能当 MCP 服务端跑。

持久化本地记忆:精选 MEMORY.md + 带日期的 Markdown 笔记,SQLite 全文搜索 + sqlite-vec 语义召回,嵌入用内置 ONNX 在设备端跑。

分层安全沙箱:Standard / Strict / Locked 三档,Linux 上用 Bubblewrap 隔离代码执行,拒绝账本在反复拒绝后自动暂停自主运行。

统一网关:运行在 127.0.0.1:18791,Web UI、CLI、Terminal、WebSocket、Slack、Telegram、Discord、飞书、钉钉、企业微信、Matrix、QQ 都共用同一个 TurnRunner。

当前版本 0.5.2(源文章写的是 0.5.0 Preview),7月3日还发了技术报告《Agentic Routing: The Harness-Native Data Flywheel》。

五、代价清醒

166 个 Open Issue。 这个数量说明项目很活跃,也说明离「省心」还有距离。

路由质量依赖分类器。 SquillaRouter 是 LightGBM + ONNX 模型,虽然提示词不出本机,但「分派到最便宜模型」的判断准确率直接决定体验——分错了,复杂任务用便宜模型跑,结果可能很惨。

沙箱不完整。 macOS 的 Seatbelt 后端只生成 profile(还没真正执行),Windows 上还没有沙箱后端。跨平台安全能力是不均衡的。

安装有坑。 macOS 终端安装可能要手动 brew install libomp,Windows 可能缺 Visual C++ 运行库,装不好路由会降级成直连单模型。

「质量分更高」是特定测试集的结果。 DRACO 100 道高难度任务上赢了,不代表所有场景都赢。单模型在风格化、创意类任务上未必输给多模型组队。

六、意味着什么

国产基础模型走到了一个临界点:单看任何一个,和国外旗舰还有差距;但在 Harness 层组织得当的时候,混着用,可以跑出更高、更稳的分数——成本只有零头。

OpenSquilla 用 Apache 2.0 开源,支持完全离线私有化部署,数据不出内网。玩法很简单:不换更贵的模型,换一种组织方式。


相关链接:

评论

暂无评论。

登录后可发表评论。