你的Agent不是失忆,是每次回忆都要开一场会

你的Agent不是失忆,是每次回忆都要开一场会

想象你雇了个哲学博士后管档案室。每收一份文件,他先写三百字散文论证这份文件和去年九月哪份合同「存在潜在语义关联」;每次有人来查档案,他把整个档案室重新梳理一遍再回答你。档案管得确实漂亮——就是查一次要等半分钟,工资按字数结算。

这就是当下大多数 Agent 记忆系统的真实写照。9 月 21 日,德州大学达拉斯分校的三位研究者在 arXiv 挂出论文 Jev-Mem,第二天冲上 Hugging Face Daily Papers 趋势榜。他们没有堆更大的模型,只做了一件事:把管档案的岗位从博士后手里拿走,交给一个只会在表格上勾勾画画的快嘴助理。

结果:记忆构建从最快对手的 1044 秒压到 158 秒,单条查询从 1.47 秒降到 0.93 秒,回答质量反而反超最强基线 11%。

Jev-Mem 冲上 Hugging Face Daily Papers 趋势榜

大模型被塞进了会计岗,这才是账单爆炸的根源

先看清楚钱烧在哪。过去两年的 Agent 记忆系统——A-MEM、MemoryOS、MAGMA 这一票——有个共同的隐含假设:记忆的分类、关联、检索路由这些决策,都让背后的自回归大模型顺手做了。反正模型那么聪明,多生成几段「分析」不算什么。

问题就出在这个「顺手」上。记忆管理是什么性质的活?每条新记忆进来,判断它是什么类型;判断它和库里的旧记忆有没有语义、时间、因果、实体四种关系;查询来了,决定先搜哪类关系、分配多少检索预算、候选证据够不够、要不要继续翻。这些全是高频、结构化的决策——输出无非是一个标签、一个分数、一个是非,永远不会有惊喜。

让一个按 token 计费、逐字生成的模型干这种活,相当于让出庭律师做记账。论文给了一个残酷的对照:MemoryOS 单次查询 32.68 秒——它把大量推理留在了检索路径上,每次回忆都是一场全员会议。

Jev-Mem 的架构图把分工画得很直白:System One 控制平面(Jev 判断模型)包揽全部高频决策,记忆平面维护四种关系图谱,System Two(大模型)只在最后合成答案时出场。

Jev-Mem 官方架构:System One 管决策,记忆平面管存储,System Two 只管答题

记忆不是词条,是一张四通八达的网

传统记忆系统的存法是「词条+向量」:来了就存,查的时候按相似度捞 Top-K。Jev-Mem 在中间加了一层——每条记忆同时挂在四种关系图上:语义(说了什么)、时间(什么时候)、因果(为什么)、实体(关于谁)。

写入流程变成五步:观察 → Jev 判断类型 → 搜候选记忆 → Jev 判断关系 → 更新图谱。检索更激进,完全抛弃了固定 Top-K:Jev 先路由问题到相关的关系图,分配检索预算,图搜索、候选打分,然后自我拷问「证据够了吗」——不够就继续扩展,够了立刻停。路由 → 检索 → 评估 → 扩展 → 再评估,一个会自己决定「翻几页档案」的循环。

最妙的是停止判断。传统检索要么翻满 K 条(浪费),要么翻到上限(更浪费)。Jev 每轮都重新评估预期收益,这项「该停了」的判断,恰恰是大模型最不擅长、判断模型最擅长的活——配置里甚至给单次查询硬性设了 16 次 Jev 调用上限和 80 的图扩展预算,工程上的克制写在明面上。

六行数据表,别只看最后一行

LoCoMo 长对话记忆基准,GPT-4o-mini 做答案模型,论文的完整对比表是这样的:

LoCoMo 六类目完整成绩:Jev-Mem 五类第一

方法 综合 多跳 开放域 对抗 构建时间 查询延迟
Full Context 0.481 0.468 0.486 0.205 N/A 1.74s
A-MEM 0.580 0.495 0.385 0.616 3636s 2.26s
MemoryOS 0.553 0.552 0.504 0.428 3276s 32.68s
Nemori 0.590 0.569 0.485 0.325 1044s 2.59s
MAGMA 0.700 0.528 0.517 0.742 1404s 1.47s
Jev-Mem 0.777 0.623 0.618 0.962 158s 0.93s

三个藏在表里的细节,比「提升 11%」这个头条更值得看:

第一,Full Context 是全场倒数第二。把全部对话原文硬塞给模型,综合得分 0.481,对抗题更是只有 0.205。长对话场景里「不给记忆系统、直接堆上下文」不是笨办法,是最差办法——多花钱,买最烂的答案。这一行的存在,就是所有记忆系统论文的立身之本。

第二,对抗题 0.962 是最惊人的数字。对抗类题目会故意往对话里掺干扰信息,诱导 Agent 引用错误的记忆。Jev-Mem 拿到 0.962,比最强基线 MAGMA 高出 0.22——判断模型「每条证据都打分、每个关系都验证」的工作方式,恰好是幻觉的天敌。防幻觉能力不是这套架构的宣传点,却是它最值钱的副产品。

第三,它输了一项。时间类推理 0.637,输给 MAGMA 的 0.650。五个第一、一个第二——这个「第二」论文和报道都不太提,但它说明 System One 路由不是万能的:纯时间线类问题,简单暴力反而占优。

构建时间与查询延迟对比:158 秒 vs 1044 秒

冷静一下:这是论文数字,不是产品承诺

上头之前,三盆冷水来自官方自己:

基准模型是 GPT-4o-mini。0.777 这个分数建立在「答案模型是 mini 档」的前提上。答案模型升级到旗舰档后,记忆系统带来的增益会不会被模型自身的上下文能力吃掉?论文没给数据,没人知道。

README 里写着复现警告。仓库明确标注「这些是论文报告的测量值」,附带的 benchmark 命令「不能直接复现论文的完整评估」,官方 demo 用的是 mock 决策和 mock 向量——能跑通流程,但「不测量回答质量」。想验证的人,得自己备好 LoCoMo 数据集和 API key 从头跑。

Jev 本身还是新东西。记忆管理绑死在 TypeSafe 的 Jev 判断模型上,等于给系统加了一层对单一上游的依赖。Jev 这家判断模型公司本身的长期可用性,是这套架构的隐性前提。

还有一件小事:这个仓库三天 63 星、5 个 fork,贡献者基本就是论文作者三人组。它是一个干净的研究复现包,不是一个开箱即用的产品——按 README 的 quick start 跑 demo 没问题,接到生产里,所有护栏和调参(关系阈值 0.60、候选上限 10、预算 80)都得自己扛。

真正的信号:判断模型的落地面,集体开张了

把镜头拉远,Jev-Mem 最有意思的地方不在论文里,在 GitHub 搜索结果里。论文挂出的同一周,「给 Jev 找记忆岗」成了一个小型赛道:给 Vercel AI SDK 做记忆层的 jev-memory、确定性程序记忆的 mem-jev、n 叉记忆树的 jev-tree-memory、给 DeepSeek Harness 做记忆插件的 dsh-memory-jev、按 token 预算过滤记忆的 jev-memory-selector——一周之内冒出至少六个第三方项目,全在做同一件事:把判断模型塞进 Agent 的记忆路径。

加上上周聊过的聊天副驾(Jev 管意图判断)、评分头(Jev 管输出打分),一个模式已经浮出水面:Jev 系创业公司不跟大模型抢活,专职接手大模型干不好也不该干的活——高频、结构化、容不得幻觉的决策。记忆管理只是这块拼图最新、也最贵的一块。

对正在被记忆账单折磨的 Agent 开发者,Jev-Mem 给出的不只是省 85% 构建时间的方案,是一个可以抄的分工原则:让大模型做它独有的推理,把「决定」从生成路径上拆出去。至于哪些决策拆得动、哪些拆了会掉质量——时间类推理输给 MAGMA 那一格,就是这个原则的边界样本。


相关链接:

评论

暂无评论。

登录后可发表评论。