如果有人说「四个便宜模型组队,能打赢一个旗舰模型」,你会觉得他在吹牛。
OpenSquilla 就是这么干的,而且把测试数据公开了:4 个国产模型并行提案 + 1 个模型聚合综合,在 100 道高难度任务上,质量分超过 Opus 4.8 和 GPT-5.5,成本只有零头。项目目前在 GitHub 6512 星。
一、先看数据
源文章(基元律动,OpenSquilla 官方公众号)公布了 DRACO 全量测试集(100 个高难度任务)的对比:
| 对比对象 | 质量提升 | 成本变化 |
|---|---|---|
| vs Fable5 | +1.05 | -67.77% |
| vs Opus 4.8 | +8.59 | -40.00% |
| vs GPT-5.5 | +10.84 | -13.00% |
阵容:DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7 四个国产模型当「前锋」,各自独立搜索、推理、提方案;第 5 个模型(GLM-5.2)当「队长」聚合四个候选,融合出最优结果。没有一个国外旗舰模型。
GitHub README 里还有一组更直观的数据(PinchBench 1.2.1,25 个任务):
| Agent | 基座模型 | 平均分 | 总成本 |
|---|---|---|---|
| OpenSquilla | 路由(Opus4.7+GLM5.1+DS4 Flash) | 0.9251 | $0.688 |
| OpenClaw | Claude Opus 4.7 | 0.9255 | $6.233 |
分数几乎打平(0.9251 vs 0.9255),成本差了 9 倍。这就是「同样的预算,让 Agent 做更多事」。
二、为什么多模型组队能赢
单个模型有三个老毛病:
- 一个人查资料,容易漏关键信息源
- 一个人算数,没人帮着对,容易算错
- 一个人干活,约束条件一多就丢三落四
四个模型从不同角度覆盖、互相补位,本质是用多样性采样 + 共识聚合把单模型的短板垫平。
源文章给了几个具体案例,比如让 AI 对比澳洲热泵烘干机,Fable5 漏了三款机型的容量,OpenSquilla 完整覆盖型号、容量、保修、能耗、澳洲场景适配和 TCO 计算逻辑——多模型交叉验证后,漏信息的概率明显更低。
三、背后是 Harness 层,不是模型
OpenSquilla 的核心观点:Agent = Models + Agent Harness。
模型负责「智能」,Harness(包裹在模型外围的可执行代码)负责「组织」——决定存储什么、检索什么、向模型呈现什么、多个模型怎么协作。当各家基础模型的能力差距逐渐缩小,决定 AI 产品质量的分水岭已经从「模型本身」转移到了「怎么驾驭模型」。
OpenSquilla 做的就是 Harness。不卷模型,卷组织方式。
四、GitHub 上的干货(源文章没讲的)
SquillaRouter:本地 LightGBM + ONNX 分类器,按长度、语言、代码、关键词和语义嵌入给每一轮打分,分派到 C0–C3 四个分级里能胜任的最便宜模型。分类在本机完成——为了做这个判断,你的提示词不会离开本机。
20+ LLM 提供商:TokenRhythm、OpenRouter、OpenAI、Anthropic、Ollama、DeepSeek、Gemini、Qwen/DashScope、Moonshot、Mistral、Groq、智谱、SiliconFlow、vLLM、LM Studio 等,支持主用+回退。
15 个内置技能 + MCP:coding、GitHub、cron、pptx/docx/xlsx/pdf、摘要、tmux、天气等,仅任务需要时加载。OpenSquilla 既是 MCP 客户端,也能当 MCP 服务端跑。
持久化本地记忆:精选 MEMORY.md + 带日期的 Markdown 笔记,SQLite 全文搜索 + sqlite-vec 语义召回,嵌入用内置 ONNX 在设备端跑。
分层安全沙箱:Standard / Strict / Locked 三档,Linux 上用 Bubblewrap 隔离代码执行,拒绝账本在反复拒绝后自动暂停自主运行。
统一网关:运行在 127.0.0.1:18791,Web UI、CLI、Terminal、WebSocket、Slack、Telegram、Discord、飞书、钉钉、企业微信、Matrix、QQ 都共用同一个 TurnRunner。
当前版本 0.5.2(源文章写的是 0.5.0 Preview),7月3日还发了技术报告《Agentic Routing: The Harness-Native Data Flywheel》。
五、代价清醒
166 个 Open Issue。 这个数量说明项目很活跃,也说明离「省心」还有距离。
路由质量依赖分类器。 SquillaRouter 是 LightGBM + ONNX 模型,虽然提示词不出本机,但「分派到最便宜模型」的判断准确率直接决定体验——分错了,复杂任务用便宜模型跑,结果可能很惨。
沙箱不完整。 macOS 的 Seatbelt 后端只生成 profile(还没真正执行),Windows 上还没有沙箱后端。跨平台安全能力是不均衡的。
安装有坑。 macOS 终端安装可能要手动 brew install libomp,Windows 可能缺 Visual C++ 运行库,装不好路由会降级成直连单模型。
「质量分更高」是特定测试集的结果。 DRACO 100 道高难度任务上赢了,不代表所有场景都赢。单模型在风格化、创意类任务上未必输给多模型组队。
六、意味着什么
国产基础模型走到了一个临界点:单看任何一个,和国外旗舰还有差距;但在 Harness 层组织得当的时候,混着用,可以跑出更高、更稳的分数——成本只有零头。
OpenSquilla 用 Apache 2.0 开源,支持完全离线私有化部署,数据不出内网。玩法很简单:不换更贵的模型,换一种组织方式。
相关链接:
暂无评论。