Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
Greg Brockman hat die Bewertung von @arcprize weitergeleitet, in der angegeben wird, dass OpenAIs GPT-6 Astra in ARC-AGI-3 den SOTA erreicht hat. Er sagte,...
Greg Brockman hat die Bewertung von @arcprize weitergeleitet, in der angegeben wird, dass OpenAIs
GPT-6 Astra in ARC-AGI-3 den SOTA erreicht hat. Er sagte, dass dieser Benchmark bereits gesättigt ist. Im Standard-Harness von Astra erzielte es 63 %, mit dem neuen Provider-Adapter-Harness 99 % und übertraf die menschliche Leistung in 96 % der ARC-AGI-3-Level; die Ranglisten-Grafik zeigt auch, dass höhere Denkebenen in der Regel kostengünstiger sind, da Astra mit weniger Aktionen durchkommt und so Modellaufrufe und Token reduziert.
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
据 Greg Brockman 转发的 @arcprize 评测,材料称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 取得 SOTA;标准 harness 得分 63%,Provider Adapter harness 得分 99%,并在 96% 关卡上超过人类表现。
材料同时称,排行榜图显示更高推理层级通常成本更低,原因是 Astra 以更少动作通关,从而减少模型调用和 token 数;Brockman 还称该基准已饱和。
Aioga 判断:这则信息的核心不只是榜单分数差异,也包括评测 harness 变化带来的结果差异。由于材料仅提供转述与摘要,SOTA、饱和及成本关系仍应结合完整评测规则核验。
可能影响:若相关评测结果可复现,ARC-AGI-3 的比较将需要同时关注 harness、动作数量、模型调用和 token 消耗;但单条材料不足以证明通用能力提升,也不代表所有任务成本都会下降。 后续观察:建议核对 ARC-AGI-3 排行榜、标准与 Provider Adapter harness 的定义、样本覆盖和复测结果,并持续观察“基准饱和”判断是否得到后续公开数据支持。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
Quelle: @gdb)
原文链接: Originalquelle öffnen
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-09-03T21:46:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。