Aioga
AI资讯 / 技巧观点
返回 AI资讯

Anthropic Claude Opus 5 在 ARC-AGI-3 基准上以 30.2% 得分大幅领先 GPT-5.6 Sol,展现全新推理行为

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-26T09:43:02.000Z热度 55

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2% 的得分,是此前 OpenAI GPT-5.6 Sol (Max) 创下的 7...

技巧观点The Decoder:AI News(RSS)

今日 AI 情报摘要

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2% 的得分,是此前 OpenAI GPT-5.6 Sol (Max) 创下的 7.8% 纪录的近四倍。

中文正文 · AI 翻译

ARC-AGI 基准的创建者表示,Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上取得巨大领先是由于其真正更强的推理能力。

Image description

该模型在 ARC-AGI-3 上得分为 30.2%,成为新的领先者。前一纪录为 7.8%,由 OpenAI 的 GPT-5.6 Sol(Max)创造。Opus 5 解决了五个之前未解决的环境,其中四个达到或超过了人类水平。这也使它领先于 Anthropic 的“Fable 级”模型,据 ARC Prize 数据,这些模型得分约为 20%。

ARC Prize 的分析:https://x.com/arcprize/status/2080716561539907928 将其领先归因于更强的逻辑推理能力,“这使得在不熟悉的环境中能够进行更自主的探索、规划和执行。”在测试过程中,Opus 5 还显示了研究人员此前从模型中未见过的行为。它首次将任务转换为代数符号表示,并独立制定了反射方程。Ad

Anthropic Claude Opus 5 在 ARC-AGI-3 基准上以 30.2% 得分大幅领先 GPT-5.6 Sol,展现全新推理行为

目前 25 个公开演示环境中已有六个被解决。完整结果:https://arcprize.org/results/anthropic-claude-opus-5,回放:https://arcprize.org/scorecards/model/anthropic-claude-opus-5-high,以及基准测试代码:https://github.com/arcprize/arc-agi-3-benchmarking 均已公开。在旧的 ARC-AGI-2 基准测试中:https://arcprize.org/leaderboard,Opus 5 得分为 90.4%,在 ARC-AGI-1 上达 97.5%。根据 ARC Prize 的说法,这两个结果与之前的最高得分相匹配,但成本略高。Ad DEC_D_Incontent-1

ARC-AGI-3 测量 AI 模型解决训练中未遇到的新任务的能力,包括人类通常可以轻松处理的任务。当前版本像玩游戏一样运行。模型必须推断交互环境的规则,规划行动,并逐步执行。这测试的是通用推理能力,而不是储存的知识。

一些 AI 系统可能已经通过了该基准测试:https://news.ycombinator.com/item?id=48935905,但它们依赖于一种称为 harness 的额外软件:https://the-decoder.com/frontier-radar-1-from-chatbots-to-problem-solvers-the-state-of-ai-agents-in-2026/。官方成绩只计算语言模型自身的表现。ARC Prize 认为,未来的 AGI 系统在解决新任务时不应依赖外部帮助。如果在 Claude Code 中使用,Opus 5 的得分可能会更高。Ad

Anthropic尚未解释其优势,但有针对性的数据标注和强化学习是合理的因素。与早期模型不同,Opus 5是在ARC-AGI-3之后开发的,其格式已经公开。这可能让Anthropic能够针对基准测试的技能和谜题格式,尽管这并不表明公司在训练中使用了完全相同的任务。标注者可能已经标注了推理轨迹、有用的操作、失败尝试和类似谜题的恢复步骤。然后,强化学习可以奖励探索、计划、规则发现和自我纠正。

在Witness上的测试:https://x.com/quietnning/status/2080786711861407883,即Guanghan Ning为互动谜题游戏制作的私人基准,显示出更有限的提升。Opus 5得分43.4,统计上与Kimi K3和Fable 5持平,而相比ARC-AGI-3的提升,它相对于Opus 4.8的改进要小得多。它在采取任何行动之前就识别出了传统谜题的隐藏规则,但在机制不太熟悉的游戏中落后于Opus 4.8。Ning表示,这种模式符合针对特定类型数据的训练,尽管Witness无法识别Anthropic使用了哪些数据。Ad DEC_D_Incontent-2

ARC-AGI-3项目的研究员之一Greg Kamradt:https://x.com/GregKamradt/status/2081031602596200614 表示,这些结果并不排除更广泛的推理提升。一款基于熟悉机制的游戏无法测试对新奇事物的适应能力,而单一的低表现结果并不能抵消模型在其他任务上的整体进步,尤其是在没有具体分数数据的情况下。Witness的设计也基于ARC-AGI-3风格的谜题,因此更好的表现可能反映了真实转移,而不是记忆化。Ad

Ning随后澄清:https://x.com/quietnning/status/2081073990614061084,Opus 5确实能够在Witness上泛化,只是远不如在ARC-AGI-3上的表现。他将这一过程比作编码基准的发展过程。作为互动推理的主要目标,ARC-AGI-3可能首先吸引最多的训练投入。覆盖更多边缘情况可以帮助模型泛化到更广泛的抽象推理任务。Ning表示,编码也遵循了类似路径,从饱和基准如HumanEval发展到频繁更新的竞赛和现今的编码代理。

保持对AI的关注。清晰、有用、无废话。

关注The Decoder,获取AI新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2% 的得分,是此前 OpenAI GPT-5.6 Sol (Max) 创下的 7.8% 纪录的近四倍。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T09:43:02.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2% 的得分,是此前 OpenAI GPT-5.6 Sol (Max) 创下的 7...

The Decoder:AI News(RSS)2026-07-26T09:43:02.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。