33 毫秒的回答,凭什么抢 3 秒的活?一个叫"决策模型"的东西正在拆 LLM 的台

33 毫秒的回答,凭什么抢 3 秒的活?一个叫"决策模型"的东西正在拆 LLM 的台

你的 Agent 每天干的大部分事,其实根本轮不到大模型出手。

这条工单分给谁?这个告警要不要人工?用户这句话是退款还是咨询?每碰到一次这种"二选一",现在的做法都是:唤起一个几百亿参数的巨兽,吭哧吭哧生成一段 JSON,再祈祷它没编。一次调用,两三秒,几分钱。

9 月 18 日,一个叫 laya 的项目上了 GitHub:421M 参数,一次前向传播,33 毫秒出答案。七天,两万多颗星。同一周,它的闭源原型 Jev 的生态项目周增近 8K 星。

一个新品类在三周内从概念、闭源发布走到开源复刻——Agent 的"决策层",正在从 LLM 手里被拆出来。

决策模型是什么:不写字,只给数

先说清楚它不是什么。它不是更小的 LLM。

Jev(TypeSafe AI 出品)和它的开源平替 laya,输出格式只有三种:choice(从选项里挑一个)、score(按标准打个分)、noul(yes/no 加概率)。没有 token 生成,没有 JSON 解析,理论上也不会幻觉——因为合法输出在 schema 里提前定死了。

TypeSafe 给它起名"System One 模型",借的是卡尼曼那套说法:LLM 的链式推理是慢思考(System 2),而这玩意儿是快直觉(System 1)——看到文本,直接给判断和置信度。

代价是什么?它放弃了写字的能力。问它为什么,它给不出理由。所以它不是来替代 LLM 的,是来站在 LLM 前面的:先让 33 毫秒的模型把 90% 的简单判断处理掉,剩下真正需要推理的,才轮到那个 3 秒的大家伙。

LangChain 的评价很直白:routing、triage、审核、相关性过滤、输出打分——所有"用 LLM 有点杀鸡用牛刀"的场景,都该换成这个。

laya:两万星的"平替",和它罕见的诚实

laya 是 ConvAI Innovations 9 月 18 日开源的,Apache-2.0,权重在 HuggingFace 上,能自托管。三个 checkpoint:421M 英文版、322M 多语言版(100+ 语言)、还有针对四种 Agent 工作流微调的版本。T4 GPU 上单次 32.8 毫秒,批量 7.2 毫秒一条。

社区的动作快得吓人:有人一周内写出了 laya.cpp 的 C++ 实现,Ollama 0.35 已经原生支持这类决策模型,laya.tools 上挂着 1400 多个基于它的衍生项目。MLX、Core ML、Rust 移植全齐了。

但这个项目最值得说的,不是星数,是 README 里那段 "Honest limits":

  • base 版本在 typed-decisions 基准上 zero-shot 成绩 0.36,随机猜是 0.318——接近随机。宣传里的 0.766 来自 fine-tuning 之后
  • Banking77 数据集上 0.425,闭源 Jev 是 0.870
  • 概率校准过度自信

翻译一下:概念成立了,模型还很早期,微调是必经之路。在两万星的狂热里自己泼自己冷水,这个比星数稀有得多。

HN 上泼的冷水,更值得看

Hacker News 上那场讨论,几条批评直接戳中要害:

上下文长度是硬伤。 一位工程师指出:laya 的 checkpoint 上下文只有 512–1024 token,Jev 是 32K。这意味着 laya 处理不了长文档——你得先把内容压缩成短摘要再喂给它,而摘要这一步本身可能就要一次 LLM 调用。

"这不就是 BERT 吗?" 有多年 NLP 经验的开发者直言:用更多数据训练的分类器,架构上并不新鲜。新鲜的是把"现成的、带校准概率的一次性分类器"做成了标准接口——价值在产品化,不在科学突破。

生产环境未必自己养 GPU。 有赞成年薪百万这条的:如果 laya 跑不快 CPU,"那我宁愿从推理服务商那里买"——自托管省的钱,可能抵不过运维 GPU 的麻烦。

创始人自己承认是"vibe coded"。 项目作者在 HN 自述这是站在一年前的 Jev 架构研究上快速搭出来的,发帖第二天就在招人提 PR。巴士因子和工程成熟度,都还在早期。

这些冷水不否定方向——它们划清了"什么时候不该用":需要推理链条的判断、需要给出理由给审计看的决策、开放式的答案空间,都不是它的菜。

同一周,另外两块拼图也在落位

laya 不是孤立事件。看同一周 GitHub Trending 上另外两个项目,会发现一层完整的基础设施正在成型。

google/ax(周增 7K 星):Google 把 Agent 定义为"新型工作负载"——既不是无状态微服务,也不是批处理任务。ax 像 Kubernetes 一样管 Agent:Task、Workspace、Gateway、Model 四个原语全写 YAML,ax apply 提交,ax ssh 进沙箱围观。v0.3.0 干了件狠事:把状态层从 etcd 迁到 Redis Streams,宁可重写也不在 K8s 上打补丁。

dream-num/univer(v1.0,周增近 4K 星):Agent 的产出物——表格、文档、幻灯片——需要一个能跑公式、保格式、可协作的容器。univer 把 Office 能力做成 TypeScript SDK,浏览器和 Node 同构。输入端(记忆、压缩)卷了几个月,终于有人开始补输出端。

三个项目凑齐了一句话:判断归决策模型,编排归 ax,产出归 univer。LLM 从"什么都干的全能选手",被拆成了流水线上只负责最难那一段的专家。

这个趋势真正意味着什么

看一遍 Jev 的定价就明白经济账:$0.042/百万输入 token,官方数据是分类任务上比同级 LLM 便宜 40–400 倍、快 20–200 倍。有团队把原本跑在 Gemini 上的工作流切过去,成本降了一个数量级。

但更深的信号是分工。过去两年所有 Agent 框架的默认假设是:LLM 是唯一的脑子,什么都问它。现在有人开始质疑这个假设——Agent 工作流里最高频的操作是判断,不是生成,而判断这件事,一个 4 亿参数的双向编码器就够,何必惊动千亿参数。

这有点像当年 CPU 和 GPU 的分工:不是谁替代谁,是承认"异构"比"全能"高效。

对普通开发者的实操建议就三条:

  1. 现在的 laya 别直接上生产——zero-shot 接近随机,必须先在自己的数据上微调
  2. 想立刻用,看 Jev——闭源但成熟,校准好,改 baseUrl 就能从 laya 迁过去
  3. 真正的机会在中间层——laya.tools 上 1400 多个衍生项目说明,围绕决策模型的基础设施(可视化、评测、微调工具)还是空地

三周前"决策模型"还只是一个博客概念。今天它有了开源权重、C++ 运行时、Ollama 支持和一篇 arXiv 论文。这个速度本身,就是最强的信号。


相关链接:

评论

暂无评论。

登录后可发表评论。