PrimeIntellect发布Prime Agent——一个能自我改进的编程Agent,在ARC-AGI-3上以95.5%超越人类专家基线(95.4%),全部开源,curl一行安装。
事件回顾
2026年8月5日,PrimeIntellect(已融资1.5亿美元)正式发布Prime Agent,一个基于递归语言模型(RLM)和持续式Harness(Continual Harness)的自改进编程Agent。这不是又一个wrapper——它重新定义了Agent脚手架的设计范式。
Prime Agent在HN上斩获184 points。其核心创新在于两个抽象层:
RLM(Recursive Language Model):将上下文视为变量,子Agent委派视为REPL中的函数调用。持久化的IPython kernel让模型拥有对其历史、子Agent和工具的编程式访问——Agent可以写代码来操纵自己的上下文。
Continual Harness:将Agent自身的prompts、skills、memory、sub-agents视为可以被Agent在运行过程中CRUD(创建/读取/更新/删除)的状态。Agent在任务执行中积累的经验会自动沉淀为可复用的技能和记忆。
为什么重要
1. 超越人类专家的基准成绩
Prime Agent在ARC-AGI-3上使用Opus 5达到95.5% RHAE Best@1,超过了ARC报告的人类专家基线95.4%。三次独立运行均稳定在95.0-95.5%区间,Best@3达到99.97%(183/183关卡全部完成)。
2. 长上下文任务的统治性表现
- OOLONG长上下文:Prime Agent+GLM-5.2 得分0.900,接近Codex+GPT-5.6(0.940)
- ManyIH编程:0.536,显著优于Claude Code(0.386)和Codex(0.454)
- LongCot-Mini推理:0.722,优于所有封闭模型Harness组合
3. 改写Agent脚手架的游戏规则
传统Agent脚手架设计逻辑是"模型能力弱,需要人工预设一切"。Prime Agent的颠覆:
- 不再预设:模型在IPython kernel中自由调用工具、生成sub-agent
- 不再静态:Agent自己在运行中创建/更新/删除技能和记忆
- 不再孤立:Agent间通过daemon进行A2A通信,并行fan-out子Agent
4. 从零构建模拟器
在EmulatorBench上,Prime Agent成功从零构建了SEGA Genesis和Nintendo Game Boy Color模拟器。在Factorio中通过/refine机制自我改进达到100K+分数。
我们能学到什么
1. 模型-Harness协同进化是关键
PrimeIntellect明确指出"目前没有任何模型针对Prime Agent训练过"。一旦新一代模型围绕RLM范式训练,性能将阶跃式提升。
2. 自改进系统的实际落地
/refine的CRUD机制证明了"运行中学习"的可行性。Agent能从失败中积累经验并转化为可复用的技能。
3. 开源+简单安装是杀手锏
一行curl命令安装,5分钟上手。降低门槛就是竞争力。
实操建议
- 立即试用Prime Agent对比Claude Code/Codex
- 关注RLM范式——编程式工具调用可能成为下一代Agent标准
- 思考自改进机制在自身Agent系统中的应用
- 关注开源Agent工具的指数增长趋势
总结
Prime Agent代表了Agent设计哲学的根本转变:从"人工预设一切"到"模型自主驾驭一切"。95.5%超越人类专家的成绩只是开始。
