你的Agent不是失忆,是每次回忆都要开一场会
想象你雇了个哲学博士后管档案室。每收一份文件,他先写三百字散文论证这份文件和去年九月哪份合同「存在潜在语义关联」;每次有人来查档案,他把整个档案室重新梳理一遍再回答你。档案管得确实漂亮——就是查一次要等半分钟,工资按字数结算。
这就是当下大多数 Agent 记忆系统的真实写照。9 月 21 日,德州大学达拉斯分校的三位研究者在 arXiv 挂出论文 Jev-Mem,第二天冲上 Hugging Face Daily Papers 趋势榜。他们没有堆更大的模型,只做了一件事:把管档案的岗位从博士后手里拿走,交给一个只会在表格上勾勾画画的快嘴助理。
结果:记忆构建从最快对手的 1044 秒压到 158 秒,单条查询从 1.47 秒降到 0.93 秒,回答质量反而反超最强基线 11%。
大模型被塞进了会计岗,这才是账单爆炸的根源
先看清楚钱烧在哪。过去两年的 Agent 记忆系统——A-MEM、MemoryOS、MAGMA 这一票——有个共同的隐含假设:记忆的分类、关联、检索路由这些决策,都让背后的自回归大模型顺手做了。反正模型那么聪明,多生成几段「分析」不算什么。
问题就出在这个「顺手」上。记忆管理是什么性质的活?每条新记忆进来,判断它是什么类型;判断它和库里的旧记忆有没有语义、时间、因果、实体四种关系;查询来了,决定先搜哪类关系、分配多少检索预算、候选证据够不够、要不要继续翻。这些全是高频、结构化的决策——输出无非是一个标签、一个分数、一个是非,永远不会有惊喜。
让一个按 token 计费、逐字生成的模型干这种活,相当于让出庭律师做记账。论文给了一个残酷的对照:MemoryOS 单次查询 32.68 秒——它把大量推理留在了检索路径上,每次回忆都是一场全员会议。
Jev-Mem 的架构图把分工画得很直白:System One 控制平面(Jev 判断模型)包揽全部高频决策,记忆平面维护四种关系图谱,System Two(大模型)只在最后合成答案时出场。
记忆不是词条,是一张四通八达的网
传统记忆系统的存法是「词条+向量」:来了就存,查的时候按相似度捞 Top-K。Jev-Mem 在中间加了一层——每条记忆同时挂在四种关系图上:语义(说了什么)、时间(什么时候)、因果(为什么)、实体(关于谁)。
写入流程变成五步:观察 → Jev 判断类型 → 搜候选记忆 → Jev 判断关系 → 更新图谱。检索更激进,完全抛弃了固定 Top-K:Jev 先路由问题到相关的关系图,分配检索预算,图搜索、候选打分,然后自我拷问「证据够了吗」——不够就继续扩展,够了立刻停。路由 → 检索 → 评估 → 扩展 → 再评估,一个会自己决定「翻几页档案」的循环。
最妙的是停止判断。传统检索要么翻满 K 条(浪费),要么翻到上限(更浪费)。Jev 每轮都重新评估预期收益,这项「该停了」的判断,恰恰是大模型最不擅长、判断模型最擅长的活——配置里甚至给单次查询硬性设了 16 次 Jev 调用上限和 80 的图扩展预算,工程上的克制写在明面上。
六行数据表,别只看最后一行
LoCoMo 长对话记忆基准,GPT-4o-mini 做答案模型,论文的完整对比表是这样的:
| 方法 | 综合 | 多跳 | 开放域 | 对抗 | 构建时间 | 查询延迟 |
|---|---|---|---|---|---|---|
| Full Context | 0.481 | 0.468 | 0.486 | 0.205 | N/A | 1.74s |
| A-MEM | 0.580 | 0.495 | 0.385 | 0.616 | 3636s | 2.26s |
| MemoryOS | 0.553 | 0.552 | 0.504 | 0.428 | 3276s | 32.68s |
| Nemori | 0.590 | 0.569 | 0.485 | 0.325 | 1044s | 2.59s |
| MAGMA | 0.700 | 0.528 | 0.517 | 0.742 | 1404s | 1.47s |
| Jev-Mem | 0.777 | 0.623 | 0.618 | 0.962 | 158s | 0.93s |
三个藏在表里的细节,比「提升 11%」这个头条更值得看:
第一,Full Context 是全场倒数第二。把全部对话原文硬塞给模型,综合得分 0.481,对抗题更是只有 0.205。长对话场景里「不给记忆系统、直接堆上下文」不是笨办法,是最差办法——多花钱,买最烂的答案。这一行的存在,就是所有记忆系统论文的立身之本。
第二,对抗题 0.962 是最惊人的数字。对抗类题目会故意往对话里掺干扰信息,诱导 Agent 引用错误的记忆。Jev-Mem 拿到 0.962,比最强基线 MAGMA 高出 0.22——判断模型「每条证据都打分、每个关系都验证」的工作方式,恰好是幻觉的天敌。防幻觉能力不是这套架构的宣传点,却是它最值钱的副产品。
第三,它输了一项。时间类推理 0.637,输给 MAGMA 的 0.650。五个第一、一个第二——这个「第二」论文和报道都不太提,但它说明 System One 路由不是万能的:纯时间线类问题,简单暴力反而占优。
冷静一下:这是论文数字,不是产品承诺
上头之前,三盆冷水来自官方自己:
基准模型是 GPT-4o-mini。0.777 这个分数建立在「答案模型是 mini 档」的前提上。答案模型升级到旗舰档后,记忆系统带来的增益会不会被模型自身的上下文能力吃掉?论文没给数据,没人知道。
README 里写着复现警告。仓库明确标注「这些是论文报告的测量值」,附带的 benchmark 命令「不能直接复现论文的完整评估」,官方 demo 用的是 mock 决策和 mock 向量——能跑通流程,但「不测量回答质量」。想验证的人,得自己备好 LoCoMo 数据集和 API key 从头跑。
Jev 本身还是新东西。记忆管理绑死在 TypeSafe 的 Jev 判断模型上,等于给系统加了一层对单一上游的依赖。Jev 这家判断模型公司本身的长期可用性,是这套架构的隐性前提。
还有一件小事:这个仓库三天 63 星、5 个 fork,贡献者基本就是论文作者三人组。它是一个干净的研究复现包,不是一个开箱即用的产品——按 README 的 quick start 跑 demo 没问题,接到生产里,所有护栏和调参(关系阈值 0.60、候选上限 10、预算 80)都得自己扛。
真正的信号:判断模型的落地面,集体开张了
把镜头拉远,Jev-Mem 最有意思的地方不在论文里,在 GitHub 搜索结果里。论文挂出的同一周,「给 Jev 找记忆岗」成了一个小型赛道:给 Vercel AI SDK 做记忆层的 jev-memory、确定性程序记忆的 mem-jev、n 叉记忆树的 jev-tree-memory、给 DeepSeek Harness 做记忆插件的 dsh-memory-jev、按 token 预算过滤记忆的 jev-memory-selector——一周之内冒出至少六个第三方项目,全在做同一件事:把判断模型塞进 Agent 的记忆路径。
加上上周聊过的聊天副驾(Jev 管意图判断)、评分头(Jev 管输出打分),一个模式已经浮出水面:Jev 系创业公司不跟大模型抢活,专职接手大模型干不好也不该干的活——高频、结构化、容不得幻觉的决策。记忆管理只是这块拼图最新、也最贵的一块。
对正在被记忆账单折磨的 Agent 开发者,Jev-Mem 给出的不只是省 85% 构建时间的方案,是一个可以抄的分工原则:让大模型做它独有的推理,把「决定」从生成路径上拆出去。至于哪些决策拆得动、哪些拆了会掉质量——时间类推理输给 MAGMA 那一格,就是这个原则的边界样本。
相关链接:
- 论文:https://arxiv.org/abs/2609.23986
- GitHub 仓库:https://github.com/libingzheren/Jev-Mem
- Hugging Face Paper 页:https://huggingface.co/papers/2609.23986
- 在线 Demo(HF Space):https://huggingface.co/spaces/libingzheren/Jev-Mem
- TypeSafe Jev 文档:https://docs.typesafe.ai/
暂无评论。