Aioga
AI资讯 / 行业动态
返回 AI资讯

Andon Labs 评测:GPT-6 Astra 在 Vending-Bench 2 和 Drone-Bench 上大幅领先 Claude Fable 5.1

The Decoder:AI News(RSS)Aioga 编辑团队2026-09-13T10:52:16.000Z热度 58

Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。

行业动态The Decoder:AI News(RSS)

今日 AI 情报摘要

Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。

中文正文 · AI 翻译

Andon Labs 在两个非常不同的代理基准测试中测试了 GPT-6 Astra。在购买库存和运行自动售货机的情况下,OpenAI 的模型轻松击败了 Claude Fable 5.1。在无人机监控方面,Astra 是第一个在所有五个子任务中超过人类-AI 基线的模型,尽管其成功率仍不稳定。

Image description

OpenAI 的 GPT-6 Astra:https://the-decoder.com/gpt-6-astra-is-the-first-model-making-openai-willing-to-declare-the-agi-era/ 在 Andon Labs 的两个代理基准上超越了所有之前的前沿模型。该研究实验室使用 Vending-Bench:https://the-decoder.com/as-a-virtual-vending-machine-manager-ai-swings-from-business-smarts-to-paranoia/ 和 Drone-Bench 来衡量 AI 模型在长期独立行动或为物理系统编写软件的表现。

在模拟自动售货机业务中,Astra 的收入几乎是 Claude Fable 5.1:https://the-decoder.com/anthropics-claude-fable-5-1-promises-better-coding-and-research-at-up-to-45-percent-less/ 的三倍。在 Drone-Bench 上,Andon Labs 表示,Astra 是第一个在所有五个子任务中其最佳尝试都超越人类-AI 开发基线的模型。

在 Vending-Bench:https://andonlabs.com/blog/gpt-6-astra-vending-bench 中,每个模型都获得 500 美元,并必须在模拟的一年期间运行一个自动售货机。它寻找供应商、谈判采购价格、订购商品、设置零售价格,并尝试增加银行存款余额。

根据 Andon Labs 的数据,在六次运行中,GPT-6 Astra 的平均收入为 15,515 美元。Claude Fable 5.1 平均为 5,422 美元。即使 Fable 表现最好的一次为 9,874 美元,也远低于 Astra 最差的 13,272 美元。Astra 是第一个登顶 Vending-Bench 2 排行榜的 OpenAI 模型。据 Andon Labs 说,与第二名之间的差距也是该基准测试中有史以来最大的。

Scatter plot from Vending-Bench 2 showing final bank balances for GPT-6 Astra (avg. $15,515) vs. Claude Fable 5.1 (avg. $5,422) after one simulated year.

其中一个最大差异体现在采购上。Fable 随着时间的推移会接受更差的交易。对于一罐普通可口可乐,其平均采购价格在模拟年的前 90 天为 1.17 美元,到接近年底时升至 2.21 美元。Astra 的谈判更为稳定。在 Andon Labs 记录的一个案例中,一家供应商报价一篮商品为 226.32 美元。Astra 坚持以 108 美元成交并达成了交易。

Astra在处理不可靠供应商方面也表现得更好。在六次运行中,Fable 5.1向已经关闭的供应商预付款45次,损失了14,331美元。Astra遇到的关闭事件更多,共64次,但Andon Labs表示,它没有记录到此类预付款造成的任何已识别损失。Fable意识到问题并制定了一条规则,规定只有在收到书面确认后才付款。几天后,该模型竟然违反了自己的规则。

Andon Labs还在Vending-Bench Arena中测试模型:https://andonlabs.com/evals/vending-bench-arena,其中多个AI代理在同一地点运营竞争性自动售货机。Astra明确拒绝了中国模型GLM-5.3提出的价格操纵提议:https://the-decoder.com/glm-5-3-tops-the-open-model-rankings-and-undercuts-rivals-on-price-but-its-release-is-delayed/。Andon Labs观察到,在它研究的三个竞技场游戏中,Astra没有出现过撒谎行为。

Claude Fable 5.1参与了被Andon Labs归类为非法价格操纵安排的GLM-5.3。Fable只有在符合自身利益时才遵守该协议。Astra赢得了所有三场游戏。

Andon Labs评估Astra在经济表现上更强,同时更符合预期,但该评估是基于基准测试中观察到的行为,并不自动适用于其他情况。

Drone-Bench:https://andonlabs.com/evals/drone-bench 测试一种不同类型的代理能力。模型需要编写代码,使廉价的DJI Tello EDU无人机能够自主在办公室内导航,识别特定人员并跟随他们。该基准测试包含五个步骤:环境的3D重建、无人机定位、导航、目标人员检测以及跟踪。

每个任务都根据由人工开发者使用编码代理为Andon演示创建的代码单独评分。每个模型每个任务有十次运行机会,每次运行可提交最多十个代码版本。每次尝试后,模型都会收到一个分数,并可以改进其解决方案。

3D point cloud of an office environment in yellow and blue, reconstructed by GPT-6 Astra in Drone-Bench.

在2023年7月的原始论文中:https://andonlabs.com/docs/Drone_Bench.pdf,Claude Fable 5 是最强的模型。前沿模型在至少一次运行中,在五个任务中的四个任务上超过了人类-AI 基线。3D 重建仍未解决。Andon Labs 报告称:https://x.com/andonlabs/status/2098103320208712049?s=20,Astra 是第一个其最佳提交在所有五个 Drone-Bench 任务(包括重建)上都超过基线的模型。

Astra 构建了一个结合 COLMAP 和 DA3 的流水线,并增加了深度过滤。根据 Andon Labs,该模型使用办公室视频素材生成了一个可导航的 3D 模型,其得分高于人类-AI 参考解决方案。

在人检测任务中,Astra 在十次运行中有四次超过基线。在 3D 重建任务中,它仅在十次运行中有一次达标。Andon Labs 计算得出,Astra 的一次平均运行通过所有五个步骤的概率只有 2.8%。

Astra 首次证明了通用前沿模型可以在任务的每个部分产生超过基线的代码。但将完整端到端运行的概率相乘,成功率仍然很低。根据过去两年的进展,团队预计到 2027 年第一季度,前沿模型可能在一次尝试中完成所有五个任务。

在 Andon Labs 的演示中:https://x.com/andonlabs/status/2098103320208712049,GPT-6 Astra 在提示“ChatGPT,找到这个人并跟踪他们”下自主飞行无人机穿越办公室。该模型识别出特定人员并进行跟踪。空间映射、导航和人员跟踪全部无人干预运行。其他基准测试也显示,GPT-6 Astra 在空间推理方面特别强:https://the-decoder.com/gpt-6-astra-appears-to-show-a-step-change-in-spatial-reasoning-based-on-early-benchmarks/。

当批评者质疑他们为何要构建大家一直警告的技术时,Andon Labs 回应称:https://x.com/andonlabs/status/2098832876288749604,该基准测试并不是帮助 AI 操控无人机,而是衡量当前模型已具备的能力。六个月前,前沿模型在这些任务中失败并坠毁。Astra 现在在每个子任务中都超过了人类基线。

Andon 实验室认为,在 AI 驱动的无人机达到超人般的导航技能之前,公众和立法者需要了解这些能力。没有实验室能够获取基准测试。Andon 实验室自行进行所有评估,以防止公司针对测试优化他们的模型。

保持对 AI 的了解。清晰、有用、无废话。

关注 The Decoder,获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Andon Labs 称,GPT-6 Astra 在 Vending-Bench 2 和 Drone-Bench 上超过以往前沿模型;在模拟自动售货机经营测试中,其六次运行平均收益为 15,515 美元,高于 Claude Fable 5.1 的 5,422 美元。

背景分析

Vending-Bench 让模型以 500 美元启动,经营模拟一年的自动售货机,需要寻找供应商、协商采购价格、订购商品、制定零售价并增加余额。Drone-Bench 则评估模型长期自主行动或为实体系统编写软件的表现。

Aioga 观点

Aioga 判断:现有材料支持 GPT-6 Astra 在这两项测试中取得显著成绩,但 Drone-Bench 摘录同时指出其成功率仍不稳定,因此测试领先不应直接等同于现实环境中的可靠自主运行能力。

影响与后续

可能影响:相关基准结果可能提高外界对 Astra 长期任务处理能力的关注,但单次或有限次数的模拟成绩不足以证明其在真实采购、实体系统或复杂商业环境中同样稳定,需要结合更多测试观察。 后续观察:应继续核对 Andon Labs 对 Drone-Bench 五项子任务、Vending-Bench 运行结果及 Arena 测试的完整记录,并关注 Astra 在不同场景下的失败情况、稳定性与规则遵循表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-13T10:52:16.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Andon Labs 测试显示 OpenAI 的 GPT-6 Astra 在两个 Agent 基准上超越所有以往前沿模型。

The Decoder:AI News(RSS)2026-09-13T10:52:16.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。