同一任务 11.71 → 70.3 分:这个开源项目治好了 Agent 的失忆症
如果你现在去测市面上最火的 Coding Agent,单次任务表现都很好看:写代码快、改 bug 准、跨文件重构也利索。
但把它们放进真实项目里连用一个月,你会撞上一堵几乎没人提的墙——失忆。
我今天要聊的开源项目叫 MemoraX Code,官方给了一组数据:同一段 3 小时复杂开发任务,不开记忆综合得分 11.71,开了记忆 70.30;关键检查项从 2/13 提升到 10/13,调用成本反而降了 22.6%。
我一开始以为这又是营销数字。把仓库、榜单、竞品都翻了一遍之后,发现值得展开聊聊。
先搞清楚它是什么
MemoraX Code 是给 Coding Agent 用的开源记忆系统。GitHub 一查:428 星、MIT 协议、8 月 1 日才创建——满打满算三周的新项目。
它给 Codex、Claude Code、DeepSeek Harness、OpenCode 四款主流 Agent 加一层共享记忆层,跨会话、跨 Agent 沉淀项目经验。
和市面上"记录对话+摘要压缩"的记忆插件不同,它的记忆分四类(这点源文章没讲全,官方 README 写得很清楚):
- Coding Memory:工程教训——哪些修复验证过、哪些方案被否了、哪些坑要绕开
- Repo Memory:仓库认知——架构地图、模块归属、入口、提交/PR 证据
- Personal Memory:你的偏好——语言、语气、解释深度、结果格式
- Procedure Memory:任务打法——可复用步骤、检查清单、前置条件、验证关卡
其中 Personal 和 Procedure 存在仓库本地 .repo_memory/ 目录里;Coding 记忆可以走云端,跨 Agent 共享给团队。
最硬的一块:Procedure Memory
记忆不是"记录发生了什么",而是提炼"这类问题该怎么处理"。
官方实验:从 123 个历史任务片段里自动提炼出 15 条工程经验,归纳成 4 类可复用流程记忆。再扔进一段 3 小时长程任务做对比,就是开头那组数据。
为什么成本降了 22.6%?因为没记忆的 Agent,大量 token 花在重复摸索已经踩过的坑上;有沉淀之后,它直接跳过试错阶段,但依然要理解需求写代码——所以降的是重复劳动,不是核心能力。
一个比喻:海马体
人脑把短期记忆固化成长久记忆,靠的是海马体。Coding Agent 的问题就是没有海马体——这次会话的认知,会话一关就清零。
MemoraX Code 做的就是这件事:把短期会话里的有效经验,固化成语义去重过的长期记忆;下次任务按意图只召回相关的部分,而不是把全部历史倒进上下文。
它没走"人写死规则"的路子,而是构造代码训练数据、设计记忆评估和奖励信号,让记忆模型自己学:什么该存、什么过时、什么时候召回。
内部测试说 85.5% 的触发行为和人工判断一致,81.2% 的记忆内容拿到正向反馈——翻译一下:还有约 15% 的时机,它可能弹出不相关的记忆。
榜单第一,但对手的数量级不对
AML(Agent Memory Leaderboard)Coding Track,MemoraX Code 拿到 62 分排第一,解题率比 Claude Mem 高 10%;综合商业榜 58.02 分,排在一众国际平台和腾讯、网易的 API 前面。
这里有个刺眼的反差:榜单第一的 MemoraX Code 只有 428 星,而它的对手 Claude Mem 在 GitHub 上有 91,407 星,Mem0 有 63,748 星——差了两个数量级。
428 星的小项目凭什么压过 9 万星的对手?往好里说,是赛道刚开、榜单还新、大家站在同一起跑线;往坏里说,这个榜单本身也有 MemoraX 自家参与,数据是厂商自述,目前还没有完全独立的第三方复现。看数据的时候留个心眼。
代价清醒:装上记忆不等于变强
有团队做过受控基准评测(Medium 上那篇 The First Controlled Benchmark of AI Memory):记忆类工具真实能省的 token 是 **15-28%**,远没到厂商爱吹的 80-95%;而且记忆不影响代码质量上限——所有条件下质量都落在 84-96% 区间。
把 MemoraX 官方宣称的 22.6% 放进这个区间,反而显出它的可信度:没吹上天,就是个"减少重复探索"的合理收益。
但也意味着:别期待"装上记忆 Agent 就变强"。它的作用是省时间、省 token、少走回头路,不是提升能力上限。
几个实在的代价:
- **85.5% 不是 100%**:接近 1/7 的触发可能是噪音,乱弹过时经验反而添乱
- 隐私边界:本地 trace 默认开启,可能包含 prompt、响应、本地路径;云端共享记忆需要注册 MemoraX 账号——"Local" 不等于全离线
- 太新:428 星、三周历史、12 个 open issue。生产环境要用,建议先观察几个版本
- 安装门槛:Node 20+,Repo Memory 还要 Python 3
一个判断
Coding Agent 的竞争维度,正在从"单次任务能力"转向"跨会话积累能力"。
模型能力决定一次任务能走多远,记忆系统决定下一次任务从哪里开始。真实软件工程是同一个仓库反复迭代、同一类问题反复出现、开发者来回切换不同 Agent——这种情况下,记忆层会变成真正的分水岭。
MemoraX Code 的价值不在于它现在多强,而在于它指明了一个方向:给 Agent 装上海马体,而不是给它更大的屏幕。
相关链接:
- MemoraX Code GitHub:https://github.com/memorax-ai/memorax-code
- 官网:https://code.memorax.net
- 记忆平台:https://platform.memorax.net
- npm 包:https://www.npmjs.com/package/@memorax/memorax-code
- 竞品 Claude Mem:https://github.com/thedotmack/claude-mem
- 竞品 Mem0:https://github.com/mem0ai/mem0
暂无评论。