Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
Greg Brockman แชร์บทวิจารณ์ของ @arcprize ว่า GPT-6 Astra ของ OpenAI ทำผลงานเป็น SOTA ใน ARC-AGI-3 เขากล่าวว่ามาตรฐานนี้ถึงจุดอิ่มตัวแล้ว คะแนนมาตรฐานของ As...
Greg Brockman แชร์บทวิจารณ์ของ @arcprize ว่า GPT-6 Astra ของ OpenAI ทำผลงานเป็น SOTA ใน ARC-AGI-3
เขากล่าวว่ามาตรฐานนี้ถึงจุดอิ่มตัวแล้ว คะแนนมาตรฐานของ Astra อยู่ที่ 63% แต่เมื่อใช้ Provider Adapter harness ใหม่ ทำได้ถึง 99% และสามารถทำได้ดีกว่ามนุษย์ใน 96% ของด่าน ARC-AGI-3; กราฟอันดับยังแสดงว่าระดับการวิเคราะห์ที่สูงขึ้นมักมีต้นทุนต่ำกว่า เพราะ Astra ใช้การกระทำน้อยลงในการผ่านด่าน ลดการเรียกใช้งานโมเดลและจำนวนโทเค็น
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
据 Greg Brockman 转发的 @arcprize 评测,材料称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 取得 SOTA;标准 harness 得分 63%,Provider Adapter harness 得分 99%,并在 96% 关卡上超过人类表现。
材料同时称,排行榜图显示更高推理层级通常成本更低,原因是 Astra 以更少动作通关,从而减少模型调用和 token 数;Brockman 还称该基准已饱和。
Aioga 判断:这则信息的核心不只是榜单分数差异,也包括评测 harness 变化带来的结果差异。由于材料仅提供转述与摘要,SOTA、饱和及成本关系仍应结合完整评测规则核验。
可能影响:若相关评测结果可复现,ARC-AGI-3 的比较将需要同时关注 harness、动作数量、模型调用和 token 消耗;但单条材料不足以证明通用能力提升,也不代表所有任务成本都会下降。 后续观察:建议核对 ARC-AGI-3 排行榜、标准与 Provider Adapter harness 的定义、样本覆盖和复测结果,并持续观察“基准饱和”判断是否得到后续公开数据支持。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
แหล่งที่มา: @gdb)
原文链接: เปิดแหล่งต้นฉบับ
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-09-03T21:46:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。