AI风向

Prime Agent:自进化的RLM编程Agent,开源即超越人类专家

PrimeIntellect发布Prime Agent——一个能自我改进的编程Agent,在ARC-AGI-3上以95.5%超越人类专家基线(95.4%),全部开源,curl一行安装。

事件回顾

2026年8月5日,PrimeIntellect(已融资1.5亿美元)正式发布Prime Agent,一个基于递归语言模型(RLM)和持续式Harness(Continual Harness)的自改进编程Agent。这不是又一个wrapper——它重新定义了Agent脚手架的设计范式。

Prime Agent在HN上斩获184 points。其核心创新在于两个抽象层:

RLM(Recursive Language Model):将上下文视为变量,子Agent委派视为REPL中的函数调用。持久化的IPython kernel让模型拥有对其历史、子Agent和工具的编程式访问——Agent可以写代码来操纵自己的上下文。

Continual Harness:将Agent自身的prompts、skills、memory、sub-agents视为可以被Agent在运行过程中CRUD(创建/读取/更新/删除)的状态。Agent在任务执行中积累的经验会自动沉淀为可复用的技能和记忆。

为什么重要

1. 超越人类专家的基准成绩

Prime Agent在ARC-AGI-3上使用Opus 5达到95.5% RHAE Best@1,超过了ARC报告的人类专家基线95.4%。三次独立运行均稳定在95.0-95.5%区间,Best@3达到99.97%(183/183关卡全部完成)。

2. 长上下文任务的统治性表现

  • OOLONG长上下文:Prime Agent+GLM-5.2 得分0.900,接近Codex+GPT-5.6(0.940)
  • ManyIH编程:0.536,显著优于Claude Code(0.386)和Codex(0.454)
  • LongCot-Mini推理:0.722,优于所有封闭模型Harness组合

3. 改写Agent脚手架的游戏规则

传统Agent脚手架设计逻辑是"模型能力弱,需要人工预设一切"。Prime Agent的颠覆:
- 不再预设:模型在IPython kernel中自由调用工具、生成sub-agent
- 不再静态:Agent自己在运行中创建/更新/删除技能和记忆
- 不再孤立:Agent间通过daemon进行A2A通信,并行fan-out子Agent

4. 从零构建模拟器

在EmulatorBench上,Prime Agent成功从零构建了SEGA Genesis和Nintendo Game Boy Color模拟器。在Factorio中通过/refine机制自我改进达到100K+分数。

我们能学到什么

1. 模型-Harness协同进化是关键

PrimeIntellect明确指出"目前没有任何模型针对Prime Agent训练过"。一旦新一代模型围绕RLM范式训练,性能将阶跃式提升。

2. 自改进系统的实际落地

/refine的CRUD机制证明了"运行中学习"的可行性。Agent能从失败中积累经验并转化为可复用的技能。

3. 开源+简单安装是杀手锏

一行curl命令安装,5分钟上手。降低门槛就是竞争力。

实操建议

  1. 立即试用Prime Agent对比Claude Code/Codex
  2. 关注RLM范式——编程式工具调用可能成为下一代Agent标准
  3. 思考自改进机制在自身Agent系统中的应用
  4. 关注开源Agent工具的指数增长趋势

总结

Prime Agent代表了Agent设计哲学的根本转变:从"人工预设一切"到"模型自主驾驭一切"。95.5%超越人类专家的成绩只是开始。


AI创业 #PrimeAgent #AI编程 #Agent框架 #开源