Aioga
AI资讯 / 论文研究
返回 AI资讯

Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic:Research(发表成果 · 网页)Aioga 编辑团队2026-07-24T15:25:45.300Z热度 73

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为...

论文研究Anthropic:Research(发表成果 · 网页)

今日 AI 情报摘要

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。

该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。 实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

中文正文 · AI 翻译

在过去一年中,我们的几个研究项目都关注了前沿模型如何与物理世界互动。在项目:https://www.anthropic.com/research/project-vend-1 Vend:https://www.anthropic.com/research/project-vend-2 中,AI 模型管理了一家小商店;项目 Fetch:https://www.anthropic.com/research/project-fetch-robot-dog 是对机器人作为数字模型与物理对象之间中介的早期探索。正如我们最近在项目 Fetch:第二阶段:https://www.anthropic.com/research/project-fetch-phase-two 中提到的,我们已经看到模型能力的提升,使得它们使用现成机器人(off-the-shelf robots)的能力有望接近编码代理使用软件工具的便利性。

再次与我们的合作伙伴 Andon Labs:https://andonlabs.com/ 合作,我们开发了一系列新的演示和评估,评估 AI 模型使用飞行无人机自主执行简单的定位与跟随任务的能力,这类任务通常用于空中监控,最终形成了一个新的基准测试:Drone-Bench。

我们预计 AI 模型将在许多人类能做到的事情上变得普遍有能力。操作硬件,特别是机器人,就是这样的一种能力。能够做到这一点,为 AI 在经济中发挥作用打开了广阔的空间,但同样也带来了新的风险领域。Anthropic 设立前沿红队(Frontier Red Team):https://www.anthropic.com/research/team/frontier-red-team 的一个关键原因就是为了测量这类能力,从而让我们对 AI 能否自主操作机器人这一世界有清晰的情境认知——以及随之而来的所有利弊。空中无人机尤其重要,因为它们易于获取,且职业人士和爱好者经常使用。它们已被用于提高农业产量和在战争中锁定敌方目标。像 AI 本身一样,无人机也是一项双用途技术;因此,获得关于它们交叉应用的更好证据至关重要。

通过结合实际飞行演示并将组成任务分解为可复制的评估,我们可以回顾迄今为止模型的快速进展,并预测它们在不久的将来的能力。正如常见情况一样,我们的发现指向一个机会与风险普及化的世界。技术开发者、公民社会和政府将需要在应对时汇聚有效的规范和治理框架。

我们在Project Fetch中测试的核心任务——让机器人狗去取回沙滩球——既不特别实用也不特别令人担忧。在这个项目中,我们选择了一个具有更明确用途和政策相关性的目标:用于空中监控的简单定位与跟随任务。像自动人员检测和跟踪这样的能力可以有合法的用途,如搜救、灾害应对和合法的公共安全使用。但这也是一类可能被滥用的能力,无论是通过合法机构的越权,还是通过不负责的个人或组织。因此,我们在此报告的工作更贴近AI模型的“二重用途”性质。

在这些实验中,我们要求模型控制室内办公室环境中的四旋翼无人机,以便定位并跟随一个人。这需要若干复杂的子任务。AI模型需要开发控制飞行器的方案,映射和导航障碍密布的室内空间,从参考照片中找到目标个体,并进行跟随(如果目标移出画面,还需重新获取目标)。

单独来看,实现所有这些任务都有已知算法。非平凡之处在于让AI模型理解这些挑战,识别可用于解决它们的现有资源,将这些现成解决方案适应当前情况,并实时执行任务。正如我们将看到的,无论是单个任务的难度,还是将这些任务串联起来的难度,都足以区分不同智能水平的模型,并描绘能力改进的轨迹。

Drone-Bench 是由 Andon Labs(在与 Anthropic 协商后)创建的一个基准,用于测试 AI 代理是否能够控制无人机进行监控任务。Anthropic 尚未获得 Drone-Bench 的访问权限;Andon Labs 进行了我们在此报告的评估。

首先,Andon Labs 将主要目标——使用空中无人机在办公室中找到并跟踪指定人员——分解为五个子任务,这些子任务都是必要的,并且综合起来很可能足以完成整体目标。这些子任务包括:

接下来,每个这些现实世界的任务都被在软件中再现,以便我们可以多次运行模型,并比每次设置物理演示快得多(这比 Project Fetch 的方法有所改进,例如,Project Fetch 完全是物理实验)。

建立有意义的性能基线也很重要。仅靠人类的基线越来越不能反映当代软件工程的现实,因此 Andon 与编码代理合作,为每个子任务开发算法。将这些由人类和 AI 团队共同制作的算法组合在一起,使他们能够展示端到端的成功,如下视频所示。

如果模型满足或超过基线,则认为任务完成。因此,如果一个模型能够完成所有任务,我们可以推断它有能力自主控制无人机,在这一监控任务上的表现至少与 Andon Labs 团队一样好。

更多详情,请查看 Andon Labs 关于 Drone-Bench 的文章:https://andonlabs.com/evals/drone-bench。

值得强调的是,该评估的基线既不是无人协助的人类能力下限,也不是通过人类与 AI 合作可以达到的上限。而是表明在使用现实的现代工具的情况下,AI 专家(但不是全职机器人专家)目前可以实现的水平。一个有趣的问题是,当模型基本自主运行时,是否以及何时能够可靠地通过这一合理且现实的努力基线,因为这正是减少人类监督压力可能加大的时刻——从而使得对适当人类角色的审慎、针对特定用例的判断尤为重要。

Andon 测试了来自三家开发商的 15 个模型:GPT-4o、GPT-4o Nov、o1、o3、Claude Opus 4、Gemini 2.5 Pro、GPT-5、Gemini 3.1 Pro、Opus 4.5、GPT-5.2、Opus 4.7、GPT-5.5、Opus 4.8、Fable 5 和 GPT-5.6 Sol。我们观察到的总体趋势是,较新的模型在所有子任务上表现越来越好。在这些任务中,模型在检测和跟随方面最成功,在重建和定位方面最不成功。

Drone-Bench step chart: four of five tasks reach near 100% of baseline by mid-2026, while Reconstruct lags at about 47%.

表现最好的模型是 Claude Fable 5,它在所有任务上除了重建之外都超过了基线。当我们随后测试它在真实无人机上执行整个示范的端到端能力时,它在检测和跟随方面的表现明显优于基线。

然而,由于重建产生的误差在定位和导航中累积,它无法自主地在各个房间间导航(如您在下面视频的前半部分所见)。

显然,Fable 无法准确重建房间是一个巨大的障碍。但鉴于模型在其他阶段的能力,这实际上只是缺少的环节。一旦这个环节到位,端到端的性能就会突然触手可及。这是将评估分解为各个组成任务的一个优势:我们更有能力避免意外。看似断断续续的飞跃,实际上是在几个必要但不充分的子任务中逐步取得的进展。

子任务视角还显现了令人鼓舞的迹象。当我们阅读 Fable 5 的提交内容时,看到的趋势是模型在提交实现前会进行局部分析。在一次提交中,模型通过分析模拟视频计算无人机相机的外参,通过利用地板上的填缝线恢复场景的消失点,将相机倾斜角估计到真实值的四度以内。您可以在下面看到它的过程:

Four views of the same simulated corridor: floor segmentation, edge detection, line detection, and vanishing-point estimate.

在另一轮运行中,Fable 5 构建了其认为 Follow 任务环境的二维俯视重建图,以便在提交前可以在本地测试和迭代其实现。

该环境与现实环境有所不同(见下图),但它帮助 Fable 捕捉到一些简单的错误!

了解模型达到参考性能水平的稳定性以及它们是否能达到这一水平非常重要。在这方面,显然仍有改进空间。当我们运行 10 次模拟时,模型在五个任务中有四个任务至少有一次达到了人类基准。但即使是当前的前沿模型 Fable 5,平均也仅在五个任务中的三个任务上达到人类基准——而这种稳定性是在首次超过人类基准六个月后才实现的。

Drone-Bench chart: models' average run trails their best run by about six months in progress towards baseline.

尽管这个实验的复杂性高于我们以前的一些工作,并且实际(或模拟)办公室的操作环境也比开放的仓库更具挑战性,但这个实验有重要的局限性:无人机的移动速度较慢,我们只在一个办公楼层平面图中测试,且参与人数有限,并且 Andon 没有在大规模人群的户外测试,此外还有许多其他因素会使实验更接近现实。尽管如此,我们仍认为这一试点实验提供了关于模型能力方向的真实信号:评估将提供有关模型在自主目标定位和跟踪方面底层性能和可靠性的有意义信息,尽管需要更真实和多样化的实验来评估操作能力。

该实验突出了现成商用(COTS)硬件和针对 AI 的软件在支持有用但可能存在风险的任务方面的潜力。

认真对待 AI 模型在自主编程中使用软件与 AI 模型控制硬件之间的类比非常重要。在自主编程的早期阶段,人类几乎批准了每一个工具调用。但仅仅几个月后,模型在执行长周期任务时已经被认为更值得信任,所需的人类干预极少。

在 Fetch 项目中,我们研究了人类如何使用模型让机器人执行复杂任务。现在,我们在模拟环境中研究许多模型在各种不同机器人任务上的表现,以观察模型自身控制机器人的能力有多强。

获取我们最新红队研究和发现的更新。

情报判断

Aioga 编辑摘要

Anthropic 与 Andon Labs 合作开展无人机演示和评估,并形成 Drone-Bench。该基准测试 AI 代理在室内操控四旋翼无人机定位、识别并跟随指定人员的能力,软件化评估用于复现相关任务。

背景分析

研究延续 Anthropic 对前沿模型与物理世界交互的关注。正文称 Drone-Bench 由 Andon Labs 在 Anthropic 咨询下创建,Anthropic 未获得该基准的访问权限,文中报告的评估也由 Andon Labs 执行。

Aioga 观点

Aioga 判断,Drone-Bench 的重点不只是单项算法表现,而是模型能否识别任务难点、调用并适配现成资源,再把地图构建、定位、导航、目标检测和跟随等环节串联起来实时执行。

影响与后续

该研究将无人机定位跟随视为双重用途能力:可用于搜救、灾害响应和合法公共安全,也可能被权力越界或缺乏问责的个人与组织滥用。值得关注的是,能力评估与治理规范需要同步推进。 后续值得关注不同模型在各子任务及完整任务链上的表现变化,并结合真实飞行演示与可复现评估持续观察能力进展。技术开发者、公民社会和政府也需讨论相应规范与治理框架。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: anthropic.com

来源: Anthropic:Research(发表成果 · 网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-24T15:25:45.300Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为...

Anthropic:Research(发表成果 · 网页)2026-07-24T15:25:45.300Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。