Aioga
AI资讯 / 行业动态
返回 AI资讯

GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-04T11:07:36.000Z热度 72

GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 So...

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后

Claude Fable 5.1 的 66 分。

中文正文 · AI 翻译

OpenAI 的 GPT-6 Astra 正在引出互相矛盾的基准评测结论。Epoch AI 将其置于领先地位,而 Artificial Analysis 的评分则认为它不比前代更好。最大惊喜来自 ARC-AGI-3,在这里,Astra 首次比普通人类工作得更高效。ARC Prize 主任 François Chollet 称这一进展比他预期的“快两倍”,并正在上调他的 AGI 预测。

两个独立实验室各自将几十个单项测试汇总成一个整体得分,但得出截然不同的结论。Epoch AI:https://epoch.ai/models/gpt-6-astra 汇总了 50 多项基准测试,将 GPT-6 Astra:https://the-decoder.com/gpt-6-astra-is-the-first-model-making-openai-willing-to-declare-the-agi-era/ 明显排在第一,得分 169,超过 267 个模型。Artificial Analysis:https://x.com/ArtificialAnlys/status/2095595489031000350 测试知识、编码和文本理解能力,给 GPT-6 Astra 评分 61,与其前代持平,落后于 Claude Fable 5.1 的 66 分。

显然,Astra 比其前代更昂贵。OpenAI 对每单位处理文本收费提高了两倍半,这使得一个任务的成本比使用 Sol 时高约 75%。与 Anthropic 相比,情况则正好相反。在编码任务上,Astra 根据 Artificial Analysis 的评测得分与 Claude Fable 5 相同,但每个任务的成本不到一半。原因在于模型的高效利用。它仅需 Sol 使用计算步骤的三分之一,以及 Opus 5 使用步骤的五分之一。

*GPT-6 Astra 在极高推理努力下;在最大负载下可达到 97.5%。ARC-AGI-1 现在被认为基本饱和。

在编码代理指数上,它以大约三分之一的 Sol 令牌使用量获得 67 分,而 Fable 5.1 领先,得 70 分。AA-Omniscience 的幻觉率从 92% 降至 51%。同时,该模型在 GDPval-AA v2 上损失约 80 Elo 分,并且在银行支持、SciCode 以及长上下文推理任务中表现下降。

Epoch AI 报告称,在新的 FrontierMath Erdős:https://epoch.ai/latest/announcing-frontiermath-erdos 中,GPT-6 Astra 是唯一一个用精益验证证明解决了 68 个未解决 Erdős 问题中两个的模型,每次尝试预算为 300 美元。另外三个解决方案来自非标准化的额外运行,消耗了超过 22 万美元的计算量,但 Epoch 表示这些不计入得分。

仔细观察Epoch的各个数据可以发现,GPT-6 Astra和竞争对手Fable 5.1迄今为止的评估标准不同。Astra在数学、知识和谜题方面领先。Fable 5.1在几乎所有编程测试中均名列前茅。但Epoch目前仅为Astra记录过一次编程分数,而且那是基于中等推理水平的测试。

最明显的跳跃出现在ARC-AGI-3:https://arcprize.org/blog/astra。测试将AI投放到陌生的游戏世界:https://the-decoder.com/arc-agi-3-offers-2m-to-any-ai-that-matches-untrained-humans-yet-every-frontier-model-scores-below-1/,其规则和目标无人解释。模型必须通过反复试验找出该做什么。GPT-6 Astra达到62.7%,测试成本约为26,000美元。其前身GPT-5.6 Sol达到7.78%,竞争对手Claude Opus 5获得30.16%。Fable 5和Fable 5.1尚未达到基准。

OpenAI报告的99.9%数据是在不同的条件下完成的。在该配置中,Astra可以使用OpenAI构建的框架,该框架在单个请求之间保持推理链,并自动总结长跑。根据ARC Prize的测量,这些运行速度约是自家工具的3.66倍,使用了49%的令牌,而在167对游戏推理对中,两者均解决了问题。

这些线束的使用及其带来的性能提升,已经成为ARC Prize与OpenAI与GPT-5.6 Sol之间的分歧点:https://the-decoder.com/openai-claims-gpt-5-6-sol-beats-opus-5-on-arc-agi-3-with-its-latest-api-and-two-additional-settings/。ARC Prize指出,只有基于内部ARC线束运行的62.7%较低数值,才实现了供应商间的公平比较,尽管未来也计划公布厂商线束的数据。

思考努力与成本之间的关系很不寻常。通常,推理水平越高,测试运行的成本就越高。而使用 Astra 则恰恰相反。在标准的 ARC 脚手架上,成本从没有推理时的 49,791 美元下降到最大推理时的 26,098 美元,同时得分从 35.2% 上升到 62.7%。根据 ARC 奖的说法,原因在于 Astra 能以更少的步骤解决游戏,这意味着模型调用次数减少,令牌数量也减少。有一个奇怪的现象特别突出:“低”水平得分为 17.5%,比完全不推理时的得分还低。ARC 奖没有对这个异常值发表评论,但 GPT-6 Astra 在其他基准测试中显示,它可以在没有推理的情况下解决长周期任务,这是因为其新架构可能在生成第一个令牌之前在内部循环处理:https://the-decoder.com/openai-calls-astra-its-most-dangerous-model-yet-watching-what-it-does-is-only-getting-harder/。

作为对比,人类测试者每 90 分钟的测试获得 115 美元工资,每解决一局游戏再加 5 美元,因此大约九次尝试下来,每局游戏大约花费 12.78 美元。但这主要支付的是时间和参与意愿。如果只计算大脑的代谢能量作为电力,ARC 奖得出每局游戏仅需 0.067 美分。

比原始得分更有趣的是效率。在发布之前,ARC 奖邀请大约 500 名测试者参与游戏,没有预先筛选,并记录每个水平中解决游戏者的中位步骤数。在使用 OpenAI 脚手架的测试中,Astra 在 96% 的关卡中以少于中位数的步骤完成了挑战,平均大约使用了一半多一点。与通常的成本衡量不同,这个指标并不追踪所消耗的计算量,而是追踪模型在掌握环境之前所需的经验量。

这正是组织者预期人类会保持长期优势的地方。这在蛮力方法中依然成立,但对于顶级模型,ARC 奖观察到几乎呈现二元模式。一旦模型掌握了机制,其执行效率便落入人类效率范围。

为了到达那里,Astra 保持自己的笔记,并发明了一种类似代数的速记法,用以记录物体、坐标、规则和未完成计划,例如 extend8 to3;retract10 to2 作为有序的移动序列,或者 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 注意到其他模型也有类似行为,但特别指出 Astra 在精确性和信息密度上的表现。在标准测试环境下,这是一个重要技能,因为模型没有保存到自身可见笔记中的信息都将丢失。

ARC 联合创始人 François Chollet 在 X 上描述道:https://x.com/fchollet/status/2095598451115614371 “对每个游戏和关卡进行即时、高效的符号世界建模。”模型甚至“开发自己的速记 DSL 来表示游戏内情况”,核心其实是“本质上是游戏特定的代数记号。”Chollet 最关心的是这种行为的来源:“Astra 展示了符号建模行为,我们之前只在复杂测试环境中见过,因此测试环境的能力正逐渐转移到模型自身。”

Astra 创建了一个紧凑、密集的符号世界模型,以完成 ARC-AGI-3 环境中的任务。

例如,在环境 s5i5 中,Astra:

- 记录了当前关卡、枢轴方向和机制长度:“L8: hub q2 (8↓)。长度:14=1…”

- 它将操作映射到精确的控件:… pic.twitter.com/tMHP002mkB:https://t.co/tMHP002mkB

— ARC 奖 (@arcprize) 2026年9月3日:https://x.com/arcprize/status/2095597607423004685?ref_src=twsrc%5Etfw

第三个测试环境展示了 Astra 在外部工具下的能力。PRO-LONG:https://github.com/alexisfox7/PRO-LONG 是由第三方开发的代理框架,ARC Prize 团队早期将其作为 ARC-AGI-3 的红队合作伙伴部署,即系统性地探索基准的极限。不同于标准设置,模型被提供了一个沙箱环境,可以在其中执行自己的代码。

Astra 利用这一点为每个游戏编写了小型程序库:包括游戏棋盘解析器、状态模型、搜索算法和规划器。在一个有守卫的迷宫游戏中,依次开发了路径查找器、战斗规则模块、巡逻移动模型,以及一个不断将自身预测与观察结果进行比对的脚本。ARC 奖未观察到任何尝试逃离沙箱的行为。这些运行条件无法与人类测试条件进行比较,因为测试对象既没有代码解释器,也没有记事本。这里测量的是模型与自建工具的综合性能。

ARC 奖明确表示不将结果解读为通用人工智能的证据。Chollet 写道:“到目前为止,我们只知道该系统的基准测试分数。”当 ARC-AGI-3 启动时,他们在每次演讲中都强调一点:“解决它并不证明 AGI。它并非作为终点。”虽然基准测试确实检验了 AGI 系统应具备的正确定性特性——即在不确定性下的探索、无指导的适应能力,以及从稀疏数据中进行因果世界建模——但这是“在小规模上”进行的。游戏运行的时间尺度比现实任务短几个数量级,因此所需数据更少,建模复杂性更低,实时学习需求也较少。

约六个月前 ARC-AGI-3 发布时,Chollet 在回答关于饱和度的问题时表示“大约一年”,取决于对基准测试的方法有多集中。因此,Astra 的到达速度比预期“快大约两倍”。“我认为进展速度会让许多人感到意外,新模型的能力将挑战人们基于早期模型形成的 AI 认知。”当有用户问他早前对 2030 年 AGI 预测是否仍然成立时,Chollet 简洁回答道:“会更早,因为进展比我预期的要快。”

结果又是一个基准测试。根据Chollet的说法,ARC-AGI-4自ARC-AGI-3发布以来一直在开发中,计划在2027年第一季度发布。基准测试是一个持续进行的过程,随着模型的发展而演变,并始终针对人工智能与人类智能之间的剩余差距。该组织认为ARC-AGI-3本身相当有限:确定性的机制、封闭的目标,没有对开放现实世界的表征。下一代计划探索包括递归自我改进和开放创新在内的内容。

保持对人工智能的关注。清晰、有用、无废话。

关注The Decoder获取人工智能新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

来源材料显示,GPT-6 Astra的综合基准结论存在分歧:Epoch AI以169分将其列为267个模型中的首位,Artificial Analysis则给出61分,与前代Sol持平,并低于Claude Fable 5.1的66分。

背景分析

Epoch AI汇总超过50项基准,Artificial Analysis覆盖知识、编程和文本理解等测试。Astra在ARC-AGI-3取得62.7%,高于Sol的7.78%和Claude Opus 5的30.16%;Fable 5及5.1尚未参测。

Aioga 观点

Aioga 判断:现有材料更支持Astra在不同测试项目上表现分化,而不是综合排名已经形成稳定共识。其ARC-AGI-3成绩和测试效率值得关注,但不同测试范围与运行条件仍使横向比较需要谨慎。

影响与后续

可能影响:Astra的评估需要结合任务类型、测试条件和成本。来源称其单位文本价格高于Sol;在编码任务中,Astra得分与Claude Fable 5相同且单任务成本低于Fable 5的一半,但这不代表其相对Fable 5.1也具备同样成本优势。 后续观察:需要继续关注Astra在标准化编程测试、长上下文推理、银行支持和GDPval-AA v2上的表现,并等待Claude Fable 5及5.1参与ARC-AGI-3后形成更直接的比较依据。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-04T11:07:36.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 So...

The Decoder:AI News(RSS)2026-09-04T11:07:36.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。