同一任务 11.71 → 70.3 分:这个开源项目治好了 Agent 的失忆症

同一任务 11.71 → 70.3 分:这个开源项目治好了 Agent 的失忆症

如果你现在去测市面上最火的 Coding Agent,单次任务表现都很好看:写代码快、改 bug 准、跨文件重构也利索。

但把它们放进真实项目里连用一个月,你会撞上一堵几乎没人提的墙——失忆

我今天要聊的开源项目叫 MemoraX Code,官方给了一组数据:同一段 3 小时复杂开发任务,不开记忆综合得分 11.71,开了记忆 70.30;关键检查项从 2/13 提升到 10/13,调用成本反而降了 22.6%。

我一开始以为这又是营销数字。把仓库、榜单、竞品都翻了一遍之后,发现值得展开聊聊。

先搞清楚它是什么

MemoraX Code 是给 Coding Agent 用的开源记忆系统。GitHub 一查:428 星、MIT 协议、8 月 1 日才创建——满打满算三周的新项目。

它给 Codex、Claude Code、DeepSeek Harness、OpenCode 四款主流 Agent 加一层共享记忆层,跨会话、跨 Agent 沉淀项目经验。

和市面上"记录对话+摘要压缩"的记忆插件不同,它的记忆分四类(这点源文章没讲全,官方 README 写得很清楚):

  • Coding Memory:工程教训——哪些修复验证过、哪些方案被否了、哪些坑要绕开
  • Repo Memory:仓库认知——架构地图、模块归属、入口、提交/PR 证据
  • Personal Memory:你的偏好——语言、语气、解释深度、结果格式
  • Procedure Memory:任务打法——可复用步骤、检查清单、前置条件、验证关卡

其中 Personal 和 Procedure 存在仓库本地 .repo_memory/ 目录里;Coding 记忆可以走云端,跨 Agent 共享给团队。

最硬的一块:Procedure Memory

记忆不是"记录发生了什么",而是提炼"这类问题该怎么处理"。

官方实验:从 123 个历史任务片段里自动提炼出 15 条工程经验,归纳成 4 类可复用流程记忆。再扔进一段 3 小时长程任务做对比,就是开头那组数据。

为什么成本降了 22.6%?因为没记忆的 Agent,大量 token 花在重复摸索已经踩过的坑上;有沉淀之后,它直接跳过试错阶段,但依然要理解需求写代码——所以降的是重复劳动,不是核心能力。

一个比喻:海马体

人脑把短期记忆固化成长久记忆,靠的是海马体。Coding Agent 的问题就是没有海马体——这次会话的认知,会话一关就清零。

MemoraX Code 做的就是这件事:把短期会话里的有效经验,固化成语义去重过的长期记忆;下次任务按意图只召回相关的部分,而不是把全部历史倒进上下文。

它没走"人写死规则"的路子,而是构造代码训练数据、设计记忆评估和奖励信号,让记忆模型自己学:什么该存、什么过时、什么时候召回。

内部测试说 85.5% 的触发行为和人工判断一致,81.2% 的记忆内容拿到正向反馈——翻译一下:还有约 15% 的时机,它可能弹出不相关的记忆。

榜单第一,但对手的数量级不对

AML(Agent Memory Leaderboard)Coding Track,MemoraX Code 拿到 62 分排第一,解题率比 Claude Mem 高 10%;综合商业榜 58.02 分,排在一众国际平台和腾讯、网易的 API 前面。

这里有个刺眼的反差:榜单第一的 MemoraX Code 只有 428 星,而它的对手 Claude Mem 在 GitHub 上有 91,407 星,Mem0 有 63,748 星——差了两个数量级。

428 星的小项目凭什么压过 9 万星的对手?往好里说,是赛道刚开、榜单还新、大家站在同一起跑线;往坏里说,这个榜单本身也有 MemoraX 自家参与,数据是厂商自述,目前还没有完全独立的第三方复现。看数据的时候留个心眼。

代价清醒:装上记忆不等于变强

有团队做过受控基准评测(Medium 上那篇 The First Controlled Benchmark of AI Memory):记忆类工具真实能省的 token 是 **15-28%**,远没到厂商爱吹的 80-95%;而且记忆不影响代码质量上限——所有条件下质量都落在 84-96% 区间。

把 MemoraX 官方宣称的 22.6% 放进这个区间,反而显出它的可信度:没吹上天,就是个"减少重复探索"的合理收益。

但也意味着:别期待"装上记忆 Agent 就变强"。它的作用是省时间、省 token、少走回头路,不是提升能力上限。

几个实在的代价:

  • **85.5% 不是 100%**:接近 1/7 的触发可能是噪音,乱弹过时经验反而添乱
  • 隐私边界:本地 trace 默认开启,可能包含 prompt、响应、本地路径;云端共享记忆需要注册 MemoraX 账号——"Local" 不等于全离线
  • 太新:428 星、三周历史、12 个 open issue。生产环境要用,建议先观察几个版本
  • 安装门槛:Node 20+,Repo Memory 还要 Python 3

一个判断

Coding Agent 的竞争维度,正在从"单次任务能力"转向"跨会话积累能力"。

模型能力决定一次任务能走多远,记忆系统决定下一次任务从哪里开始。真实软件工程是同一个仓库反复迭代、同一类问题反复出现、开发者来回切换不同 Agent——这种情况下,记忆层会变成真正的分水岭。

MemoraX Code 的价值不在于它现在多强,而在于它指明了一个方向:给 Agent 装上海马体,而不是给它更大的屏幕。


相关链接:

评论

暂无评论。

登录后可发表评论。