Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
Greg Brockman deelt een beoordeling van @arcprize waarin staat dat OpenAI's GPT-6 Astra SOTA heeft behaald op ARC-AGI-3, en hij zegt dat deze benchmark al...
Greg Brockman deelt een beoordeling van @arcprize waarin staat dat OpenAI's GPT-6 Astra SOTA heeft
behaald op ARC-AGI-3, en hij zegt dat deze benchmark al verzadigd is. Astra behaalt 63% op de standaard harness, en met de nieuwe Provider Adapter harness bereikt het 99%, waarmee het 96% van de ARC-AGI-3 niveaus beter presteert dan mensen; de ranglijstgrafiek laat ook zien dat een hoger redeneerniveau doorgaans lagere kosten met zich meebrengt, omdat Astra met minder acties door het niveau komt, waardoor het modelgebruik en het aantal tokens wordt verminderd.
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
据 Greg Brockman 转发的 @arcprize 评测,材料称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 取得 SOTA;标准 harness 得分 63%,Provider Adapter harness 得分 99%,并在 96% 关卡上超过人类表现。
材料同时称,排行榜图显示更高推理层级通常成本更低,原因是 Astra 以更少动作通关,从而减少模型调用和 token 数;Brockman 还称该基准已饱和。
Aioga 判断:这则信息的核心不只是榜单分数差异,也包括评测 harness 变化带来的结果差异。由于材料仅提供转述与摘要,SOTA、饱和及成本关系仍应结合完整评测规则核验。
可能影响:若相关评测结果可复现,ARC-AGI-3 的比较将需要同时关注 harness、动作数量、模型调用和 token 消耗;但单条材料不足以证明通用能力提升,也不代表所有任务成本都会下降。 后续观察:建议核对 ARC-AGI-3 排行榜、标准与 Provider Adapter harness 的定义、样本覆盖和复测结果,并持续观察“基准饱和”判断是否得到后续公开数据支持。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
Bron: @gdb)
原文链接: Open oorspronkelijke bron
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-09-03T21:46:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。