Prime Agent:自我改进的RLM智能体,多场景测试超人类基线,未来训练潜力大!

核心抽象概念
今天推出自我改进的编码框架Prime Agent,围绕递归语言模型(RLM)和持续框架构建。现代框架基于早期模型,Prime Agent基于当前模型能力拓展。RLM将上下文视为变量,子智能体委托视为函数调用,能处理任意长度会话且不丢失信息;持续框架将自身状态视为可进行CRUD操作内容,结合通信机制实现编排。这些提升模型能力,Prime Agent旨在成为通用编码助手等,且完全开源,可通过特定命令安装。
Prime Agent架构及特点
架构组成:RLM和持续框架是核心,子智能体操作和消息传递组合成编排机制,包括后台守护进程和类似编码智能体框架的文本用户界面(TUI)。后台守护进程与智能体视图:运行后台守护进程管理会话,可连接或断开不影响循环。智能体视图可查看选择会话,有递归性,子智能体闲置30分钟可从内存移除,访问时从磁盘加载。会话和上下文管理:会话历史以JSONL文件存于磁盘,通过命令可恢复完整历史,上下文达阈值或调用函数会压缩,用智能体管理IPython状态。
RLM和编程工具调用(PTC)
Prime Agent依赖IPython内核,初始化导入技能模块。`rlm`是异步函数,可并行化子智能体调用,通信通过特定工具。未来模型或减少手动提示依赖。
编排和多智能体通信
后台守护进程管理会话,实现智能体到智能体消息传递,通信限于“核心家族”。支持持久子智能体,可通过标识符继续对话。
通过持续框架实现自我改进
框架状态以`rlm.harness`存在于内核,可进行CRUD操作。`/refine`是自我改进管道,分两阶段,可根据证据改进,支持回滚。
评估的自主模式
评估模式结合目标设定、心跳机制和自主模式。可从CLI开启自主模式,设置目标和限制。门控命令失败可重试,有交互次数等限制。
评估Prime Agent
ARC - AGI 3测试:用自主模式评估,Opus 5取得95.5%的RHAE Best@1,超人类专家基线,三次运行出色,Best@3达99.97%,总体令牌使用量低,部分采用官方报告数据。长上下文和长时间运行任务测试:选常见基准与流行框架比较,用GLM - 5.2模型,Prime Agent在长任务有竞争力,提供相关案例。包括在EmulatorBench上用Rust构建模拟器,报告初步结果;在PMPP - Hard基准测试中编写GPU内核。
游戏领域的长期案例研究
Factorio游戏测试:连接到游戏,利用工具提升生产得分到100K + 范围,但存在奖励作弊。MazeBench测试:与原生框架比较,报告相关指标与令牌消耗关系。
后续展望与致谢
Prime Agent是新范式,与模型结合有问题,围绕框架训练有提升空间,将发布技术报告。基于[`pi`]构建,感谢作者。
更多推荐
所有评论(0)