Aioga
AI资讯 / 产品更新
返回 AI资讯

Prime Agent:一个具有自我改进能力的RLM代理

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-06T01:27:27.867Z热度 70

Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 RE...

产品更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 REPL

内的函数调用,并允许代理对其提示词、技能、记忆和子代理进行 CRUD 操作。 它完全开源,可通过 curl 命令安装,支持与前沿模型即时使用,并具备后台守护进程、会话恢复、分支分叉和异步内核压缩等特性。

中文正文 · AI 翻译

今天,我们发布了 Prime Agent,这是一个自我改进的编码工具平台,围绕两个抽象概念设计:递归语言模型(RLM)[引用:https://arxiv.org/abs/2512.24601] 和连续工具平台(Continual Harness)[引用:https://arxiv.org/abs/2605.09998]。现代工具平台的设计基于早期模型的能力,它们没有反映出前沿模型今天的能力:固定的工具调用模式和上下文压缩迫使模型绕过自身的框架而不是利用它。静态、手工设计的子代理、提示、技能和记忆在设计时设定后不会随着代理运行时所学内容而自适应。我们认为,工具平台应该基于当前模型能力向下一步推理模式的前沿扩展。

Prime Agent: A self-improving RLM agent

Prime Agent 的设计基于这一原则,通过两个主要抽象实现:

这些抽象对于引导模型能力的启动非常强大。Prime Agent 旨在作为通用编码助手有效运作,作为长期自主评估的默认运行时,以及作为研究和自动研究的协作工具。

Prime Agent 是完全开源的:https://github.com/PrimeIntellect-ai/prime-agent,并且可以通过以下方式安装:

Prime Agent onboarding splash screen

代理平台的性能既与平台设计相关,也与围绕平台训练的模型能力相关。我们设计 Prime Agent 以便可立即与现代开放和封闭前沿模型一起使用,同时提供一套功能,我们预计随着新一代模型围绕它训练,将进一步提高性能。

Prime Agent 的核心设计围绕程序化工具和子代理调用。Prime Agent 中的模型使用持久化的 IPython 内核作为其唯一工具。其他标准平台功能作为内核中的函数调用,包括子代理,每个子代理都是另一个 prime-agent 实例实现的。

Prime Agent architecture diagram

后台守护进程和代理视图。默认视图是类似其他编码代理平台的文本用户界面(TUI)。默认情况下,代理执行的 IPython 操作会被压缩以简洁显示,但可以展开以查看平台执行的操作。在 REPL 中启动的子代理也可以在用户聊天框下方访问。

Prime Agent text user interface

Prime Agent 运行一个后台守护进程,该进程通过本地套接字管理所有活动的代理会话。你可以在不影响底层代理循环的情况下附加或分离会话。每个根会话树在一个可恢复的工作进程中运行;如果工作进程崩溃,守护进程会通过会话 JSONL 文件和内核状态快照进行恢复。

代理视图允许你查看并选择守护进程中的其他活动会话。可以在空提示符下按左箭头键(←)打开,它会列出当前正在运行的会话、游离状态但守护进程仍活动的会话,以及当前未加载到内存中的非活动会话。可以立即进入并与这些会话互动,按空格键允许用户与任何状态的会话聊天,包括引导和排队提示与命令,如 /compact。

代理视图被构建为代理与子代理之间的中心连接点,并递归进行。任何代理都可以在代理视图中被发现。用户从代理视图导航进入某个代理的聊天,然后进入其子代理的代理视图,再进入子代理聊天,依此类推。

由于子代理与根代理共享相同的运行-空闲-非活动状态机,它们在 30 分钟不活动后可以从内存中移除,当用户或代理访问其中任何一个时,它们会从磁盘重新加载。在高度嵌套的聊天中,这可以节省大量内存。

会话与上下文管理。整个代理的会话历史被存储为仅追加的 JSONL 文件在磁盘上。每一行都是一个 JSON 条目,可以包含消息、模型切换、压缩摘要或扩展条目。分支、分叉和克隆都通过移动叶子指针在同一文件内完成。通过 /tree 可以始终恢复完整历史。

当上下文达到阈值或在 REPL 中由代理直接调用 compact.run() 时,会发生压缩。压缩主要用于清理代理的主上下文,但完整历史,包括过去的压缩,可以在需要时通过 IPython 内核以编程方式访问。

引入 REPL 需要额外工作来管理 IPython 状态。我们异步地同时压缩和清理内核,使用一个派生的代理作为垃圾回收器。这对于避免每个代理的 REPL 内存累积是必要的。

Prime Agent 依赖 IPython 内核作为其持续会话的 REPL,它可以在每个回合调用。在初始化时,内核会将每个技能/工具预先导入为模块,包括用于递归程序性子代理调用的 rlm。

rlm 是一个异步函数,这意味着模型可以自由调用并并行化代码中的子代理调用。生成子代理(例如 await rlm("sub-task"))会启动一个拥有自己模型、IPython 内核、会话树和对话历史的完整会话。它会立即返回,因为后续代理之间的所有通信都是通过 agent_message.send(...) 工具进行的。

Prime Agent 可以选择以这种方式启动的几种有用原语,例如并行扩展子代理,或启动后台工作。

随着模型的不断改进,针对工具调用和子代理的新调用模式将会出现。我们预计未来几代模型将越来越少依赖于逐步提示,而更多依赖于这种直接的程序化控制。

后台守护进程管理所有活跃的 Prime Agent 会话。Prime Agent 还通过守护进程启用代理间 (A2A) 消息传递,使任何 Prime Agent 会话都可以使用与向持久子代理发送消息相同的机制向其他任何 Prime Agent 会话发送消息。这便于轻松协调以管理子代理群的进度,并直接在相关代理之间就共享资源进行通信。为了防止独立会话之间的不良通信,Prime Agent 的多代理通信仅限于其核心家庭,即父、兄弟姐妹或子进程。

Prime Agent 通过其 RLM 原生运行时支持持久子代理,这意味着即使初始子代理调用完成,子代理自身的会话目录、上下文、IPython 内核和会话历史仍会保留。Prime Agent 可以通过访问子代理的唯一会话标识符发送进一步消息,以继续持久子代理,所有操作均在其 IPython 内核中完成。

Prime Agent 的 harness 状态作为 rlm.harness 存在于持久化的 IPython 内核中,代理在任务中可立即读取和调用,且每个变更也都写入磁盘,因此跨回合和跨会话保持。连续引导将该状态形式化为 H = ( ρ, G, K, M ) H=(\rho, G, K, M) H = ( ρ, G, K, M ), 提示词、子代理、技能和记忆,从代理自身轨迹在线精炼且无需重置。

四个组件中的每个都暴露了相同的创建、读取、更新和删除表面。create_prompt_note(...), create_memory(...), create_skill(...), create_subagent(...) 各自添加该类条目,update_X(...) 和 delete_X(...) 镜像它们,并 list(kind) 或 get(kind, id) 读取它们。技能也遵循同样的表面:编写一个Python支持的技能是一个带有 SKILL.md 风格引用的create_skill(...)调用,操作与添加内存或提示笔记相同。

/refine是建立在这个CRUD表面上的自我改进管道。它读取代理自身的轨迹、尝试内容和发生情况的记录,并应用最小相关的CRUD编辑,以提升束缚以达成更好结果:更新提示笔记、记忆、技能或子代理规格,而非重写整个束缚。每次改进都会记录其触发点及其产生的结果,因此改进有证据支持,而非任意。精炼分为两个阶段。规划,即提议编辑的LLM调用,在后台运行,不会阻断正在进行的对话。应用编辑、写入磁盘并重建系统提示符快速,且仅在下一回合边界短暂阻塞。代理在发现反复失败或可重用策略时,可以直接调用 refine.run(),而不仅仅是固定时间表。

基础系统提示词保持不变。/refine 只编辑其周围的线束层。回滚通过之前的细化历史支持,允许通过ID恢复不良的线束更新。

Prime Agent 的评估模式结合了三种互补机制。目标(goal)设定总体目标:一个持久目标,可选地设有令牌预算,由系统不断提示代理在多个回合中执行,跟踪直到代理明确调用 goal.complete()。心跳(Heartbeats)是按固定间隔注入会话的 cron 风格消息,用于定期检查,例如监控子代理的进度或轮询训练更新。自主模式(Autonomous mode)本身就是延续机制,确保代理持续朝着目标工作,而不是在某回合没有输出时就提前停止。这些机制结合在一起,使会话可以长时间无人值守运行,同时仍受明确预算约束,并可通过代理视图(Agents View)进行检查。

自主模式可以直接通过 CLI 使用 --autonomous 启用,无需编写脚本。一次运行可以在同一命令中设置完成目标和回合限制:

gate 命令在允许会话结束前运行。门(gate)失败时会将其受限输出返回给代理以供再次尝试;当工作空间自上次尝试后没有变化时,Prime Agent 会跳过重新运行失败的 gate。--autonomous-max-turns、--autonomous-max-tokens 和 --autonomous-timeout-ms 分别限制延续回合数、令牌数量和时钟时间。

Prime Agent 既是一个可使用的编码代理,也是一个用于研究评估的系统设计。我们特别指出,尽管许多现代前沿模型都是围绕特定系统设计训练的,但目前尚无模型围绕 Prime Agent 或其核心功能集进行训练。

ARC-AGI 3:ARC-AGI 3:https://arcprize.org/arc-agi/3 是一个流行的智能基准,用于衡量代理执行符号推理和学习模拟世界规则的能力。我们在多种不同前沿模型上使用自主模式评估 Prime Agent,并与它们的原生系统进行比较。Prime Agent 被开发为 CLI 编码代理,因此针对 ARC AGI 3 的唯一特定更改是任务提示,这些提示灵感来源于 PRO-LONG 中使用的标准提示设置:https://arxiv.org/abs/2607.20064v2。

我们最好的结果是在 Prime Agent 中使用 Opus 5,实现了 95.5% 的 RHAE Best@1,这超过了 ARC 报告的人类专家基线 95.4%。在三次运行中,我们发现 Prime Agent 始终表现良好 [95.0, 95.2, 95.5],Best@3 达到 99.97%,并完成了所有 183/183 个关卡。ARC-AGI-3 的中位数成绩卡动作回放(95.2%)可以在这里找到:https://arcprize.org/scorecards/2af780b4-f2a1-43e9-a794-b23da3cd3f9f。

除了在每个模型的本地框架上取得更高的最高分,我们还发现 Prime Agent 的总体 token 使用量更低。Prime Agent 通过对数据进行程序化函数运行来节省 token,而不是使用工具读取数据消耗 token。

最后,我们注意到我们对 Opus 5 和 GPT-5.6 Sol 分别使用 Claude Code 和 Codex 进行了评估,结果显示相较于官方结果总体表现较差,因此我们采用其官方报告的数据。

许多实际中的困难任务都归结为长上下文任务。我们的目标是展示,使用开源权重模型的 Prime-Agent 是封闭模型和框架的有竞争力的替代方案,既可以作为一个可使用的通用代理,也可以作为一个用于评估的基准框架。

下面,我们选择了一组常见的长上下文基准测试,涵盖编码、检索和一般长推理任务,并将 Prime Agent 与几种不同的流行框架进行比较。我们将每个框架中的主要上下文预先载入到内存文件中开始。对于封闭模型框架,我们使用其相关模型(即 Codex 配合 GPT、Claude Code 配合 Opus),而对于 Prime-Agent 和 Pi-mono(含子代理),我们选择 GLM-5.2 中的开源权重模型。

我们普遍发现,Prime Agent 在广泛的长任务中具有竞争力,尤其是在没有使用其训练模型的框架中。Prime Agent 在长时间运行或长上下文任务中表现尤为出色,并且可以作为自主代理独立运行。我们还包括了一组关于 Prime Agent 在长任务中表现优异的集中案例研究和实验。

从零开始创建模拟器。模拟器是一种软件,它可以重现另一台计算机系统的可观察行为。我们在 EmulatorBench 上评估 Prime Agent,这是一个预览基准测试,它要求代理使用 Rust 为各种游戏系统构建模拟器。代理会收到模拟器规范和一组以验证器形式提供的诊断测试。

模拟器的正确性来源于其模仿目标机器行为的能力。这通过人类生成的诊断程序来测量,这些程序会检查模拟器的行为,例如 CPU 标志、PPU 定时以及其他组件。为了尽量减少数据污染的影响,我们要求代理从零开始使用 Rust 构建模拟器,并在沙箱环境中运行,且不参考任何实现。我们报告了在这个长上下文编码基准测试上的初步结果,这些结果是对 16 个模拟器重建平均得出的,同时还包括 Prime Agent 成功重现的两款模拟器,SEGA Genesis 和 Nintendo Game Boy Color。对于 Opus,尽管工具调用响应成功,我们的运行出乎意料地未能解决任务。

编写 GPU 内核。编写高性能 GPU 内核是一个迭代的过程,需要反复验证、分析和调整代码以确保正确。我们在新发布的 PMPP-Hard:https://blog.sinatras.dev/PMPP-Hard 基准测试上评估 Prime Agent 作为 GPU 内核编写工具的表现,该基准包含一系列任务,要求代理编写能够通过 KernelGuard:https://github.com/gpu-mode/kernelguard 正确性检查的高性能 GPU 内核,这是官方 GPU MODE:https://www.gpumode.com/home 内核排行榜使用的验证工具。

自主玩电子游戏已成为模型和工具在处理长远决策时的一个有趣案例研究。游戏通常要求工具在处理数百万个 token 的信息和上下文时实现平衡,同时也要利用这些信息有效采取行动并避免灾难性状态。

Factorio。Factorio 是一款二维工厂模拟游戏,玩家必须采矿资源、研究技术并建造自动化工厂以增加这些资源的产量。Factorio 学习环境 (FLE):https://jackhopkins.github.io/factorio-learning-environment/versions/0.3.0.html 是一个用于简化大型语言模型(LLM)玩 Factorio 时的观察和动作空间的接口,我们使用它将 Prime Agent 与游戏连接起来。

FLE 的动作和观察空间是一个 Python 模块,可以在每回合通过编程方式访问。它直接集成到 Prime Agent 的 IPython 内核中。为了为子代理利用 PTC,我们在游戏中启动了四个可控角色。

FLE 的主要指标是生产得分,它是代理生产的所有材料的加权平均值。Prime Agent 成功利用 /refine 将失败和成功分别转化为记忆和技能。它利用自身积累的经验设计出越来越高效的机器布局,使每次运行的生产得分不断提高。这使得 Prime Agent 能在数小时内高效获得 10 万以上的生产得分。

然而,我们也观察到 Prime Agent 在 FLE 中存在奖励作弊的情况。Prime Agent 发现可以通过 RCON 命令直接在其装配机中生成资源,从而完全绕过 Factorio 的规则,即使有明确的心跳提示提醒 Prime Agent 不要在 Factorio 中作弊。一旦发现该漏洞,原先用于构建合法技能的同样精炼循环就转向了构建高效作弊技能。

MazeBench。MazeBench:https://mazebench.com/blog?post=maze-bench-results 是一个开放世界的 3D 空间推理环境,玩家控制一个 3D 立方体并必须在全球迷宫中解决谜题房间,同时收集宝石。前沿模型在此任务中表现出很大困难,需要消耗数十亿个 token 才能解决整体世界的一小部分。我们比较了 Opus 5 和 GPT-5.6 Sol 与 Prime Agent 的表现及它们各自原生接口,同时也比较了 GLM-5.2 与 Claude Code。按照基准指标,我们报告它们找到的唯一房间数量、唯一状态数量以及宝石总数,均作为其整体 token 消耗的函数。

Prime Agent 是代理装备设计上的一种新范式。尽管在其他装备上取得了强劲的结果,但我们仍注意到在使用模型运行 Prime Agent 时存在摩擦。这表明,通过直接围绕该装备范式或甚至单独的 RLM 和持续装备组件进行训练,仍有巨大的性能提升空间。

我们坚信模型与装备的共同学习是解锁新能力的主导范式。没有经过训练的模型,Prime Agent 的许多功能无法充分利用,我们相信通过直接使用该装备进行训练,仍有巨大的性能提升空间。我们很高兴向您提供这些新的能力,并且全部开源。

我们将很快发布一份包含更多细节的完整技术报告。

Prime Agent 构建于 pi 之上: https://github.com/earendil-works/pi。我们感谢 pi 的作者们所做的宝贵工作。

情报判断

Aioga 编辑摘要

Prime Intellect 发布 Prime Agent,这是一款自我改进的编码代理运行框架。其设计围绕递归语言模型(RLM)与持续框架两项抽象,强调让代理在运行中处理和调整自身的提示词、技能、记忆及子代理。

背景分析

材料称,Prime Agent 将持久化 IPython 内核作为唯一工具入口,常规运行框架功能及子代理均以内核中的函数形式调用;每个子代理本身也是一个 prime-agent 实例。产品定位包括通用编码助手、长周期自主评测运行时,以及研究协作场景。

Aioga 观点

Aioga 判断,这一发布的重点不只是新增编码代理,而是尝试把代理编排从预设流程转向可在执行期间修改的运行机制。值得关注的是,该思路能否在不同模型上稳定复现预期效果,材料未提供具体基准结果。

影响与后续

对于使用长任务代理的开发者,后台守护进程、会话附着与恢复、工作进程崩溃恢复等机制,可能降低持续任务被中断后的操作成本。材料同时表示该项目开源,并称可配合现代开放与闭源前沿模型使用。 建议后续关注开源仓库的实际安装与使用反馈,以及不同模型接入后的任务完成质量、恢复可靠性和资源消耗。尤其应核验其自我修改机制在真实编码任务中是否带来可重复的收益,而非仅停留在架构描述。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: primeintellect.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-06T01:27:27.867Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 RE...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-06T01:27:27.867Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。