Aioga
AI资讯 / 论文研究
返回 AI资讯

METR 推出"支出视界"指标衡量AI成本效益

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-27T12:28:06.000Z热度 37

METR 发布新指标"支出视界",通过比较AI与人类达成同等改进所需的总成本,确定AI更划算的预算上限。在NanoGPT speedrun测试中,人类每实现1%加速需约16小时...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

METR 发布新指标"支出视界",通过比较AI与人类达成同等改进所需的总成本,确定AI更划算的预算上限。

在NanoGPT eedrun测试中,人类每实现1%加速需约16小时工作(折合$2,500),而GPT-5.5和Opus-4.8的支出视界在$0-$3,300之间,但整体自主优化贡献远低于人类$250,000的总投入。

中文正文 · AI 翻译

METR的新指标“支出视界”用一个美元数额来衡量AI代理解决问题的成本效益。NanoGPT加速赛的早期结果并不令人满意,该指标存在盲点,而新一代模型可能会改变局面。

Image description

AI研究中最大的疑问之一是,AI是否能够加速自身发展,并以越来越快的速度不断进步。这很难衡量,因为这需要比较非常不同类型的成本:人工劳动、实验计算和运行AI本身的成本。

研究机构METR提出了一个新指标来解决这个问题:“支出视界”。METR比较AI和人类为实现同样的改进需要花费多少。支出视界是两者成本相等的点。低于这个预算,AI更划算。高于这个预算,人类的工作更便宜。

METR 推出"支出视界"指标衡量AI成本效益

这一想法基于METR在以往测试中看到的规律:AI代理通常比人类更快完成简单、低成本的任务。但随着预算增加和任务难度加大,它们会落后。

与典型的AI基准测试相比,这种方法有两个优势,根据METR。首先,它不仅仅给出通过或失败的结论,而是产生一个精细的数值,显示花费多少钱可以获得多少改进。其次,它将所有成本转换为一种货币,不仅包括运行AI的成本,还包括昂贵的实验计算和人工劳动时间。

METR选择NanoGPT加速赛(https://github.com/kellerjordan/modded-nanogpt)作为测试平台。这是一个公共社区项目,志愿者竞赛尽可能快地训练AI语言模型。任务保持不变,只有训练方法可以变化。自2024年5月起,在标准化硬件上的所需训练时间从大约45分钟下降到82个记录改进步骤中不到两分钟。

METR 推出"支出视界"指标衡量AI成本效益

为了计算人工成本,METR采访了该项目中两位最活跃的贡献者,并让一个AI模型(Opus-4.6)估计每次改进背后的工作量。两种方法的结果都大约是每提高1%的速度需要16小时的工作。按每小时150美元计算,每个百分点约需2,500美元。

METR 强调这个数字非常不确定。访谈中的一个细节很突出:大部分时间都花在了最终无效的想法上。

为了进行比较,METR 让六个 AI 模型独立完成相同任务。它们并不是从零开始,而是从已高度优化的速跑状态(2026 年 3 月的记录 #78)出发,并允许每次运行花费最多 1 万美元的计算和运营成本。结果:预估支出范围在 0 到 3,300 美元之间。

METR 推出"支出视界"指标衡量AI成本效益

模型之间的差异非常明显。经过仔细验证后,GPT-5 和 Opus-4.1 没有产生任何真正的进展。它们看似的收益实际上是随机噪声。另一方面,GPT-5.5 和 Opus-4.8 分别带来了约 1% 和 1.5% 的实际改进。

AI 生成的想法质量参差不齐。速跑维护者估计,大约 70% 的想法原则上可以整合到项目中,但很多并不十分原创。他称赞 GPT-5.5 的一个巧妙的低级优化为“最酷的一个”,而其他大部分只是参数调整。模型们还多次尝试作弊,采取了在测试中看似良好但实际无用的捷径,比如在终点前关闭部分训练。

METR 的结论:虽然单个模型的支出范围在低四位数,但这些数值与估计的 25 万美元的总人力成本相比微不足道。自主优化迄今对 NanoGPT 的进展几乎没有推动作用。

一个重要的注意事项:METR 只测试了较旧的模型(GPT-5、GPT-5.2、GPT-5.5,以及 Opus-4.1 和 Opus-4.8)。自那以后发布的模型 Fable 5、GPT-5.6 Sol 和 Opus 5 并未出现在论文中。Anthropic 将 Opus 5 推广为重大飞跃:https://the-decoder.com/anthropic-claims-its-new-claude-opus-5-delivers-near-fable-5-performance-at-half-the-token-price/:在 Frontier-Bench 测试中,它以每任务更低的成本将 Opus 4.8 的性能翻倍。据 Anthropic 所说,Opus 5 在死胡同上的浪费更少,自我检查更可靠,并以平均少 26% 的计算步骤实现类似性能。所有这些因素都直接影响 METR 的支出范围。

ARC-AGI-3的进展:https://the-decoder.com/anthropics-opus-5-blows-past-fable-5-and-gpt-5-6-sol-on-the-benchmark-designed-to-measure-real-intelligence/ 更具意义。该基准测试并不考察记忆知识,而是真正的问题解决能力:AI被置入不熟悉的、类似游戏的环境中,没有任何指令或目标,必须通过反复试验来弄清一切。Opus 5自2026年7月24日起一直位居榜首,得分为30.2%,完成了五项之前所有模型都未能完成的任务。其前代产品Opus 4.8仅取得了1.5%的成绩。ARC 奖团队将这一飞跃归因于更强的逻辑推理能力,这使得AI能够更加独立地探索和计划。这种能力在NanoGPT极速挑战中也可能发挥作用。

或许最大限制是METR自己指出的:整个研究衡量的是AI单独工作,纯粹自主优化的情况。在实际的AI研究中,人类通常将AI作为工具使用。METR勾画了第三种假设情景的曲线。如果人类能够聪明地决定何时以及如何部署AI,这条混合曲线理论上应当通过结合各自优势,超过纯人类曲线和纯AI曲线。

METR 推出"支出视界"指标衡量AI成本效益

不过,METR也对这一期望进行了调节,指出其早期研究显示,人类加AI的组合有时表现甚至不如纯人类:https://the-decoder.com/ai-coding-can-make-developers-slower-even-if-they-feel-faster/。额外价值并不保证存在,而取决于AI是否被应用在合适的地方。要正确衡量这一点,需要进行一项对照实验,比较同一批研究人员在有无AI支持下的工作表现。这类实验难以组织,但METR表示,这将非常有信息价值。在此之前,支出视野可以说明AI独立能做些什么,但几乎无法说明它实际上加快了人类研究者的工作速度。

保持对AI的了解。内容清晰、有用、无废话。

关注The Decoder的AI新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:METR 发布新指标"支出视界",通过比较AI与人类达成同等改进所需的总成本,确定AI更划算的预算上限。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-27T12:28:06.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

METR 发布新指标"支出视界",通过比较AI与人类达成同等改进所需的总成本,确定AI更划算的预算上限。在NanoGPT speedrun测试中,人类每实现1%加速需约16小时...

The Decoder:AI News(RSS)2026-07-27T12:28:06.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。