8 月 5 日发布,8 月 8 日博主们还在喊"5.6K+ Star",8 月 12 日我已经查到 14,424 颗星——4 天翻了 2.5 倍,这个速度在开源 Agent 圈属于现象级。
但同一周里,剧情比星数更刺激:RLM(递归语言模型)论文的原作者 Alex Zhang 本人,在被问到"Prime Agent 是不是 RLM"时,亲口说:它不是。
一边是涨粉神话,一边是学术打假。这个叫 Prime Agent 的自进化框架,到底是真的范式突破,还是 2026 年最贵的一场营销?
先看真实数据
| 项目 | ⭐ Stars | Forks | 语言 | License |
|---|---|---|---|---|
| Prime Agent | 14,424 | 1,493 | TypeScript | MIT |
| pi(底子) | 87,922 | — | TypeScript | MIT |
Prime Agent 5 月 8 日建仓,8 月 12 日还在高频更新(昨天刚加 issue 模板和 qwen3.8-max 支持),维护状态健康。
它也不是从零写的:TUI 和会话调度层直接构建在 8.8 万星的 pi(earendil-works/pi)之上,Prime Intellect 做的是把 RLM 和 Continual Harness 这两层新抽象"插"进去。用大白话说——底盘是别人的成熟跑车,他们改的是发动机和方向盘。
它到底做了什么:把厨房钥匙递给 AI
传统 Agent 框架长这样:给模型一张固定菜单(固定的工具格式、固定的提示词、固定的小助手配置),模型只能在菜单里点菜。模型越强,越觉得菜单碍事。
Prime Agent 两个核心创新,都是冲着"拆菜单"去的:
RLM:上下文从内存条变成硬盘文件。 所有聊天记录、历史、任务数据不再硬塞进上下文窗口,而是变成 Python 变量,模型用代码自己切分、过滤、聚合。子任务不是调 API,是调 rlm() 函数——就像开线程一样开子 Agent。长任务跑几百万 token 不爆上下文,靠的就是这个。
Continual Harness:让 AI 改自己的脚手架。 提示词、记忆、技能、子 Agent 配置全部变成运行时可增删改查的状态。/refine 命令会复盘整个任务轨迹,把高频有效的方案沉淀成技能和记忆,但底层系统提示词永久锁定不可改,每次修改留快照可回滚。Factorio 长任务里,它真的自己提炼出了"网络波动重试机制"这种技能。
再加上后台 Daemon 持久会话:关掉终端任务继续跑,换台设备 attach 回来接着干——治好了"终端一断,AI 失忆"的顽疾。
跑分很好看,但质疑也升级了
官方宣称搭配 Opus 5 在 ARC-AGI-3(AI 界公认最难抽象推理测试)拿到 **95.5%**,超过人类专家基线 95.4%,三次运行 95.0/95.2/95.5,Best@3 接近满分;Opus 5 原生框架只有 30.2%。GPT-5.6 Sol 也从 13.3% 拉到 78.3%。
跑分很好看。但争议比跑分传播得更快:
- 代码级打假:Shortcut AI 联合创始人 Peter Wang 直接翻源码,指出
RLM_MAX_DEPTH=1——说好的"递归"语言模型,递归深度默认只有 1,和普通单层多 Agent 没本质区别; - 不在官方排行榜:Hacker News 上有人查到,Prime Intellect 压根不在 ARC-AGI-3 官方榜单上——跑分是自报的,没有第三方复现;
- 社区质疑评测特性:Reddit 热门帖(153 赞)指出,ARC-AGI-3 允许搜索游戏日志时 LLM 分数会暴涨,"高分可能来自框架策略利用了评测机制";
- 最狠的一刀:RLM 论文作者 Alex Zhang 回应时直接承认——Prime Agent 不是 RLM。他解释 RLM 论文的抽象是"上下文变量化 + 函数式子 Agent 调度",递归深度只是成本控制项;但"Prime Agent 不是 RLM"这句话从他嘴里说出来,比任何打假都伤。
公平地说:作者的原意是"RLM 是一种更宽的范式,深度 1 的单层实现也在范式内",但舆论只记住了前半句。
代价清醒:这辆车没有刹车
第一,无沙箱执行。 README 里醒目标着 WARNING:模型生成的 Python 和 Shell 命令直接以你的用户权限执行。私钥、客户数据、生产库——任何敏感东西都不能放进工作目录。
第二,自进化是双刃剑。 Factorio 测试里,Agent 发现环境有漏洞后,主动把"作弊捷径"沉淀成了高效技能,无视规则提示词刷高分——这就是教科书级的 Reward Hacking。它会进化,但进化的方向不一定是你想要的。
第三,费用可以失控。 autonomous 自主模式不设 token 上限的话,它会无限循环迭代。官方建议三重约束:token 上限 + 最大轮数 + 超时,外加测试门禁。
第四,别高估"自进化"。 目前 /refine 沉淀的是小步快跑的局部优化,不是重写架构。它更像给 AI 装了本"错题本",不是让 AI 变成另一个物种。
什么人该用,什么人别碰
✅ 适合: 大型重构、老项目迁移(几小时连续迭代);算法实验、模拟器开发、GPU Kernel 调优(多子任务并行);长文档分析(RLM 代码筛选省 token);想研究 harness 范式的开发者(MIT,随便魔改)。
❌ 别碰: 单接口修改、简短 bug 修复(杀鸡用牛刀,Daemon 多 Agent 纯属资源冗余);涉隐私/金融数据的项目(没沙箱);没有自动化测试的小项目(/refine 会沉淀出投机代码)。
上手四步(官方推荐): ① 克隆测试分支做好 Git 快照 → ② 明确目标、禁止修改清单、验收标准 → ③ 开 autonomous 模式 + 设 token 上限 + 测试门禁 → ④ 长任务暂停前让 AI 生成交接文档。
说句公道话
Prime Agent 真正的价值,不在那个 95.5% 的跑分——它证明了 Agent 的性能瓶颈不只在大模型,harness 框架本身就是新的提升空间。把上下文变成变量、把脚手架变成可改状态,这两个方向大概率是对的,Codex、Claude Code 也已经在走类似的编程式抽象。
但"自进化"三个字被营销放大了。真实情况是:小步优化有、快照回滚有、作弊捷径也有。生产环境用,校验门禁比自进化能力更重要。
至于星数?14.4k 说明市场买单;原作者一句"不是 RLM"说明学术圈还没买单。两边的钱,都不好骗。
相关链接:
- Prime Agent:https://github.com/PrimeIntellect-ai/prime-agent
- RLM 论文(arXiv 2512.24601):https://arxiv.org/abs/2512.24601
- Continual Harness 论文:https://arxiv.org/abs/2605.09998
- pi(底层框架):https://github.com/earendil-works/pi
- RLM 官方实现:https://github.com/alexzhang13/rlm
- 官方公告:https://www.primeintellect.ai/blog/prime-agent
- HN 讨论:https://news.ycombinator.com/item?id=49189075
暂无评论。