Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
Greg Brockman は @arcprize のレビューをリツイートし、OpenAI の GPT-6 Astra が ARC-AGI-3 で SOTA を達成したと述べ、彼はこのベンチマークは既に飽和していると述べています。Astra の標準ハーネスのスコアは 63% で、新しい Provider Ad...
Greg Brockman は @arcprize のレビューをリツイートし、OpenAI の GPT-6 Astra が ARC-AGI-3 で SOTA
を達成したと述べ、彼はこのベンチマークは既に飽和していると述べています。 Astra の標準ハーネスのスコアは 63% で、新しい Provider Adapter ハーネスでは 99% に達し、ARC-AGI-3 の 96% のステージで人間のパフォーマンスを上回りました。 ランキング図は、推論レベルが高いほど通常コストが低いことも示しています。 これは Astra がより少ないアクションでクリアし、モデル呼び出しとトークン数を減らしているためです。
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。
Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;
排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。
据 Greg Brockman 转发的 @arcprize 评测,材料称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 取得 SOTA;标准 harness 得分 63%,Provider Adapter harness 得分 99%,并在 96% 关卡上超过人类表现。
材料同时称,排行榜图显示更高推理层级通常成本更低,原因是 Astra 以更少动作通关,从而减少模型调用和 token 数;Brockman 还称该基准已饱和。
Aioga 判断:这则信息的核心不只是榜单分数差异,也包括评测 harness 变化带来的结果差异。由于材料仅提供转述与摘要,SOTA、饱和及成本关系仍应结合完整评测规则核验。
可能影响:若相关评测结果可复现,ARC-AGI-3 的比较将需要同时关注 harness、动作数量、模型调用和 token 消耗;但单条材料不足以证明通用能力提升,也不代表所有任务成本都会下降。 后续观察:建议核对 ARC-AGI-3 排行榜、标准与 Provider Adapter harness 的定义、样本覆盖和复测结果,并持续观察“基准饱和”判断是否得到后续公开数据支持。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: x.com
出典: @gdb)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: social-summary · Updated: 2026-09-03T21:46:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。