Aioga
AI资讯 / 行业动态
返回 AI资讯

OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-04T00:07:48.000Z热度 72

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provi...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter

harness 得分 99.9%(成本 $19K),均为 SOTA。

中文正文 · AI 翻译

ARC-AGI-3 是通过新颖、抽象、回合制环境研究智能智能的基准。智能体必须探索、推断目标,并构建环境内部模型,以有效规划行动而无需明确指令。你可以自己玩 ARC-AGI-3:/tasks/ls20。

Greg Kamradt

你的浏览器不支持嵌入视频。

这些环境仅包含核心知识先验:https://arcprize.org/arc-agi#:~:text=towards%20general%20intelligence.-,Core%20Knowledge%20Priors,-A%20principle%20underlying,并通过与人类参与者的受控测试进行难度校准。人类可以解决100%的环境:/blog/arc-agi-3-human-dataset。

ARC-AGI系列的目标是衡量当前人工智能与AGI之间的“残余差距”。我们将AGI定义为系统能够像人类一样高效地习得人类所能掌握的任何技能的能力。

ARC-AGI-3 是 ARC-AGI 基准系列的第三代。它测试了超越 ARC-AGI-1:/arc-agi/1 和 ARC-AGI-2:/arc-agi/2 的代理能力。每一代都在前一代基础上不断扩展——随着前沿人工智能能力的进步,我们的基准也必须跟随进步。

ARC-AGI-3 测试代理智能的四个组成部分:

ARC-AGI-3 leaderboard showing GPT-6 Astra Standard and Provider Adapter results

通过我们的标准束,标准束允许模型在整个环境中携带其选择保留的笔记。OpenAI的Astra(最高)在ARC-AGI-3半私密:/results/openai-gpt-6-astra中得分62.7%,价格为2.6万美元。使用Provider Adapter harness的提供者适配器束保留请求间的不透明推理状态,并使用压缩处理以进行更长时间的对话,允许模型重用之前的工作。,Astra(高)得分99.9%,价格为1.9万美元。两者均为最先进的成绩。查看完整排行榜:/leaderboard。

在推理努力达到最大水平时,Astra 解决游戏更高效,所需动作更少,因此相较于其他推理努力水平,整体成本更低。

作为成本对比,在我们的受控测试中,人类参与者每90分钟游戏获得115美元,外加每场完成游戏5美元。参与者每场尝试大约九局游戏,约为12.78美元(未计奖金)。

大部分费用用于支付参与者参加测试的时间和意愿,而非大脑消耗的能量(这是与人工智能更接近的替代指标)。如果只看大脑能量,并以电为价,估计值降至每场约0.6美分,或每场游戏0.067美分。1:#fn-1

除了评分,Astra的回放展示了它如何将陌生的游戏机制转化为有用的可行模型。有三项发现尤为突出:它开发的紧凑代数符号、与人类相比的行动效率,以及它构建的自定义工具。

在玩 ARC-AGI-3 时,Astra 选择想要继续传递的策略笔记。它跟踪了对象、坐标、规则和未完成的计划,同时使用了为环境生成的自定义领域专用语言符号。

我们在其他模型中也见过类似行为:https://x.com/arcprize/status/2080716567760007317,但Astra的笔记因其精确度和信息密度而突出。它将场景提炼成一个紧凑的代码符号模型:物体的位置、交互方式以及具体需要以何种顺序执行哪些动作。这是一种即时代数速记,而非完整的编程语言。例如:

Astra playing s5i5 while recording compact symbolic notes

在启动ARC-AGI-3之前,我们测试了大约500名公众成员,以建立行动效率的基线,简单来说,就是人们解决每个环境的速度。参与者的选拔并非基于解谜经验或能力。2:#fn-2

对于每个关卡,我们根据完成该关卡的玩家的中位行动数定义了“人类基线”。这为比较人类与AI表现提供了参考。需要更多动作的AI动作效率较低,而需要动作较少的AI则更高效。

在提供者适配器框架中提供者适配器框架保留请求间的不透明推理状态,并使用压缩处理以进行更长时间的对话,使模型能够重复使用之前的工作。Astra(最大)在96.0%的层级中使用了比人类基线更少的动作,平均每层的动作减少了51.7%。这是一个重要的里程碑。这意味着根据ARC-AGI-3的动作效率衡量,Astra在达到人类水平上达到并超过了。

顺便提一下,在我们推出 ARC-AGI-3 之前,我们假设行动效率将继续作为人类与 AI 之间的分水岭。我们预计,即使 AI 解决了一个环境,它可能也需要比人类更多的探索(行动)。对于蛮力方法来说,这仍然是正确的,但前沿 AI 展现出更类似二进制的模式。一旦前沿 AI “理解”了机制,它通常可以在接近人类效率的范围内执行。

阿斯特拉的行动效率与人类的比较

Scatter plot comparing Astra actions with the human baseline for each completed ARC-AGI-3 level

每个点代表 Astra(最大化)完成的一个关卡。实线下方的点表示所需行动少于人类基线。

上图比较了 Astra 完成每个关卡所使用的行动次数与我们的人类基线。这进一步说明了为什么 ARC-AGI-3 测量的是行动效率,而不仅仅是任务完成情况。仅完成任务的评分会告诉我们 Astra 完成了一个环境,但无法反映它解决问题的学习效率。

大多数基准只衡量成本效率,即使用的计算资源,而行动效率衡量的是完成任务所需的环境经验量。

Astra 的结果显示,它执行解决方案所需的交互次数少于人类基线。

我们还在 PRO-LONG 环境中评估了 Astra:https://github.com/alexisfox7/PRO-LONG(论文:https://arxiv.org/pdf/2607.20064),这是 ARC-AGI-3 的早期红队合作伙伴。在这个高级设置中,Astra 可以访问一个沙盒执行自定义代码 3:#fn-3。

我们观察到 Astra 为每个游戏创建了一套自定义工具:棋盘解析器、游戏状态模型、搜索算法、规划器及持续笔记。在更复杂的运行中,Astra 甚至生成了小型、针对特定游戏的软件库。

例如,在 tu93:/tasks/tu93,一个带守卫和移动巡逻的迷宫类游戏中,Astra 从导航开始并构建了 maze_solver.py。它在 combat_solver.py 中添加了战斗规则,在 patrol_solver.py 中模拟移动的巡逻,并使用 sync_state.py 将其预测与观察结果进行对比。

在PRO-LONG中检查Astra的表现是有用的,因为我们可以看到它在使用外部工具时的能力。然而,这代表了与我们的受控人类测试不同的评估条件。我们的测试参与者没有使用代码解释器、草稿本等工具,因此应将PRO-LONG的结果理解为模型和其工具的综合表现。

Astra using a custom maze solver while playing tu93 in the PRO-LONG harness

我们针对ARC-AGI-3的标准测试方法询问模型在相同的最小化、提供者中立接口下的表现如何。它提供了解决每个游戏所需的所有信息,但将决定在可见笔记中保留什么的责任留给模型。我们认为,未来的AGI应该能够在这些条件下解决ARC-AGI-3。共享接口还使我们能够在不同提供者之间进行一致、可比较的评估。

另一种情况是:当模型可以使用其提供者为其设计的上下文管理功能时,它的表现如何?对于Astra来说,这意味着在请求之间保留不透明的推理状态(我们看不到的)并使用压缩功能管理较长的对话。

在Provider Adapter测试中,Astra在ARC-AGI-3半私有环境中的最佳观察得分从62.7%提升至99.9%。在公有和半私有以及所有推理等级中,Provider Adapter的运行在总记录耗时上大约快3.66倍,并且在两种测试方法解决的167对游戏推理组合中,总使用令牌数减少了49%。

未来,我们将在ARC-AGI排行榜上报告标准测试和Provider Adapter测试的结果,并清楚标注每种评估条件。我们的开源测试仓库:https://github.com/arcprize/arc-agi-3-benchmarking 和测试政策文件:/policy 都记录了这两种方法。

ARC-AGI-3仍然是研究人员和智能体探索陌生环境、发现规则和通过互动学习的有用平台。Astra的结果也是一个值得庆祝的重要里程碑。从我们的角度来看,Astra代表了前沿模型能力的明显跃升。

当我们发布 ARC-AGI-3 时,我们明确表示:https://arxiv.org/pdf/2603.24621,饱和基准并不代表“实现 AGI 的证据”。因此,虽然我们认为 Astra 代表了在泛化方面的有意义进展,但我们并不声称它是 AGI。

ARC-AGI 基准系列设计为与前沿 AI 同步发展。这在新兴研究问题与 AI 能力进步之间建立了反馈循环。ARC-AGI-3 是我们的第一个交互式基准,它要求 AI 高效综合因果世界模型并在没有具体指令的情况下实现目标。Astra 达到了这一标准。同时,ARC-AGI-3 的范围和格式都严格限定,其环境具有确定性、封闭式的机制和目标。它并不代表现实世界的复杂性和开放性。

我们正在积极探索应当塑造下一代基准的问题,包括如何评估递归自我提升和开放式创新。Astra 的进展有助于澄清哪些 AI 能力尚无法达到,以及哪些问题仍未解决。

感谢 François Chollet、Mike Knoop、Matt Mazur、Ethan Bond 和 Derek Smith 对本文的早期审阅。

开始使用并接收官方竞赛更新和新闻。

情报判断

Aioga 编辑摘要

来源材料称,OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 的 Standard harness 得分为62.7%,成本为2.6万美元;在 Provider Adapter harness 得分为99.9%,成本为1.9万美元,均被列为当前最高成绩。

背景分析

ARC-AGI-3用于研究智能体在新颖、抽象、回合制环境中的探索、目标推断和行动规划能力。来源称,人类能够解决全部环境;该系列旨在衡量人工智能与通用人工智能之间的剩余差距。

Aioga 观点

Aioga 判断:Astra 的结果显示,不同 harness 的状态保留与推理机制可能显著影响成绩和成本,单看最高分不足以完整反映系统表现,评估时需要同时关注测试配置、行动数量与资源消耗。

影响与后续

可能影响:后续模型比较应明确区分 Standard harness 与 Provider Adapter harness,并同步披露成本和行动效率;99.9%的成绩不代表模型已在所有环境中达到人类水平,也不足以单独证明已实现通用人工智能。 后续观察:需要关注 ARC-AGI-3 完整排行榜、不同模型在统一 harness 下的表现,以及来源是否进一步公开行动数量、成本计算方式和人类参与者测试的可比细节。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: arcprize.org

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-04T00:07:48.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provi...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-04T00:07:48.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。