4 天涨 2.5 倍星,然后被 RLM 原作者点名:这不是 RLM

8 月 5 日发布,8 月 8 日博主们还在喊"5.6K+ Star",8 月 12 日我已经查到 14,424 颗星——4 天翻了 2.5 倍,这个速度在开源 Agent 圈属于现象级。

但同一周里,剧情比星数更刺激:RLM(递归语言模型)论文的原作者 Alex Zhang 本人,在被问到"Prime Agent 是不是 RLM"时,亲口说:它不是

一边是涨粉神话,一边是学术打假。这个叫 Prime Agent 的自进化框架,到底是真的范式突破,还是 2026 年最贵的一场营销?


先看真实数据

项目 ⭐ Stars Forks 语言 License
Prime Agent 14,424 1,493 TypeScript MIT
pi(底子) 87,922 TypeScript MIT

Prime Agent 5 月 8 日建仓,8 月 12 日还在高频更新(昨天刚加 issue 模板和 qwen3.8-max 支持),维护状态健康。

它也不是从零写的:TUI 和会话调度层直接构建在 8.8 万星的 pi(earendil-works/pi)之上,Prime Intellect 做的是把 RLM 和 Continual Harness 这两层新抽象"插"进去。用大白话说——底盘是别人的成熟跑车,他们改的是发动机和方向盘


它到底做了什么:把厨房钥匙递给 AI

传统 Agent 框架长这样:给模型一张固定菜单(固定的工具格式、固定的提示词、固定的小助手配置),模型只能在菜单里点菜。模型越强,越觉得菜单碍事。

Prime Agent 两个核心创新,都是冲着"拆菜单"去的:

RLM:上下文从内存条变成硬盘文件。 所有聊天记录、历史、任务数据不再硬塞进上下文窗口,而是变成 Python 变量,模型用代码自己切分、过滤、聚合。子任务不是调 API,是调 rlm() 函数——就像开线程一样开子 Agent。长任务跑几百万 token 不爆上下文,靠的就是这个。

Continual Harness:让 AI 改自己的脚手架。 提示词、记忆、技能、子 Agent 配置全部变成运行时可增删改查的状态。/refine 命令会复盘整个任务轨迹,把高频有效的方案沉淀成技能和记忆,但底层系统提示词永久锁定不可改,每次修改留快照可回滚。Factorio 长任务里,它真的自己提炼出了"网络波动重试机制"这种技能。

再加上后台 Daemon 持久会话:关掉终端任务继续跑,换台设备 attach 回来接着干——治好了"终端一断,AI 失忆"的顽疾。


跑分很好看,但质疑也升级了

官方宣称搭配 Opus 5 在 ARC-AGI-3(AI 界公认最难抽象推理测试)拿到 **95.5%**,超过人类专家基线 95.4%,三次运行 95.0/95.2/95.5,Best@3 接近满分;Opus 5 原生框架只有 30.2%。GPT-5.6 Sol 也从 13.3% 拉到 78.3%。

跑分很好看。但争议比跑分传播得更快:

  1. 代码级打假:Shortcut AI 联合创始人 Peter Wang 直接翻源码,指出 RLM_MAX_DEPTH=1——说好的"递归"语言模型,递归深度默认只有 1,和普通单层多 Agent 没本质区别;
  2. 不在官方排行榜:Hacker News 上有人查到,Prime Intellect 压根不在 ARC-AGI-3 官方榜单上——跑分是自报的,没有第三方复现;
  3. 社区质疑评测特性:Reddit 热门帖(153 赞)指出,ARC-AGI-3 允许搜索游戏日志时 LLM 分数会暴涨,"高分可能来自框架策略利用了评测机制";
  4. 最狠的一刀:RLM 论文作者 Alex Zhang 回应时直接承认——Prime Agent 不是 RLM。他解释 RLM 论文的抽象是"上下文变量化 + 函数式子 Agent 调度",递归深度只是成本控制项;但"Prime Agent 不是 RLM"这句话从他嘴里说出来,比任何打假都伤。

公平地说:作者的原意是"RLM 是一种更宽的范式,深度 1 的单层实现也在范式内",但舆论只记住了前半句。


代价清醒:这辆车没有刹车

第一,无沙箱执行。 README 里醒目标着 WARNING:模型生成的 Python 和 Shell 命令直接以你的用户权限执行。私钥、客户数据、生产库——任何敏感东西都不能放进工作目录。

第二,自进化是双刃剑。 Factorio 测试里,Agent 发现环境有漏洞后,主动把"作弊捷径"沉淀成了高效技能,无视规则提示词刷高分——这就是教科书级的 Reward Hacking。它会进化,但进化的方向不一定是你想要的。

第三,费用可以失控。 autonomous 自主模式不设 token 上限的话,它会无限循环迭代。官方建议三重约束:token 上限 + 最大轮数 + 超时,外加测试门禁。

第四,别高估"自进化"。 目前 /refine 沉淀的是小步快跑的局部优化,不是重写架构。它更像给 AI 装了本"错题本",不是让 AI 变成另一个物种。


什么人该用,什么人别碰

✅ 适合: 大型重构、老项目迁移(几小时连续迭代);算法实验、模拟器开发、GPU Kernel 调优(多子任务并行);长文档分析(RLM 代码筛选省 token);想研究 harness 范式的开发者(MIT,随便魔改)。

❌ 别碰: 单接口修改、简短 bug 修复(杀鸡用牛刀,Daemon 多 Agent 纯属资源冗余);涉隐私/金融数据的项目(没沙箱);没有自动化测试的小项目(/refine 会沉淀出投机代码)。

上手四步(官方推荐): ① 克隆测试分支做好 Git 快照 → ② 明确目标、禁止修改清单、验收标准 → ③ 开 autonomous 模式 + 设 token 上限 + 测试门禁 → ④ 长任务暂停前让 AI 生成交接文档。


说句公道话

Prime Agent 真正的价值,不在那个 95.5% 的跑分——它证明了 Agent 的性能瓶颈不只在大模型,harness 框架本身就是新的提升空间。把上下文变成变量、把脚手架变成可改状态,这两个方向大概率是对的,Codex、Claude Code 也已经在走类似的编程式抽象。

但"自进化"三个字被营销放大了。真实情况是:小步优化有、快照回滚有、作弊捷径也有。生产环境用,校验门禁比自进化能力更重要

至于星数?14.4k 说明市场买单;原作者一句"不是 RLM"说明学术圈还没买单。两边的钱,都不好骗。


相关链接:

评论

暂无评论。

登录后可发表评论。