Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
Greg Brockman이 @arcprize의 평가를 리트윗하며 OpenAI의 GPT-6 Astra가 ARC-AGI-3에서 SOTA를 달성했다고 밝혔다. 그는 이 벤치마크가 이미 포화 상태라고 언급했다. Astra 표준 하니스 점수는 63%였으나 새로운 Provider Adap...
Greg Brockman이 @arcprize의 평가를 리트윗하며 OpenAI의 GPT-6 Astra가 ARC-AGI-3에서 SOTA를 달성했다고 밝혔다. 그는 이 벤치마크가 이미
포화 상태라고 언급했다. Astra 표준 하니스 점수는 63%였으나 새로운 Provider Adapter 하니스에서는 99%를 기록했으며, ARC-AGI-3 레벨의 96%에서 인간 성능을 능가했다. 순위표 그림은 더 높은 추론 단계일수록 일반적으로 비용이 낮다는 것을 보여주는데, Astra가 더 적은 액션으로 단계를 클리어해 모델 호출 수와 토큰 수를 줄였기 때문이다.
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
据 Greg Brockman 转发的 @arcprize 评测,材料称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 取得 SOTA;标准 harness 得分 63%,Provider Adapter harness 得分 99%,并在 96% 关卡上超过人类表现。
材料同时称,排行榜图显示更高推理层级通常成本更低,原因是 Astra 以更少动作通关,从而减少模型调用和 token 数;Brockman 还称该基准已饱和。
Aioga 判断:这则信息的核心不只是榜单分数差异,也包括评测 harness 变化带来的结果差异。由于材料仅提供转述与摘要,SOTA、饱和及成本关系仍应结合完整评测规则核验。
可能影响:若相关评测结果可复现,ARC-AGI-3 的比较将需要同时关注 harness、动作数量、模型调用和 token 消耗;但单条材料不足以证明通用能力提升,也不代表所有任务成本都会下降。 后续观察:建议核对 ARC-AGI-3 排行榜、标准与 Provider Adapter harness 的定义、样本覆盖和复测结果,并持续观察“基准饱和”判断是否得到后续公开数据支持。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: x.com
출처: @gdb)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: social-summary · Updated: 2026-09-03T21:46:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.