Aioga
AI资讯 / 论文研究
返回 AI资讯

MirrorCode:AI 能独立完成的最大规模软件项目基准测试

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-04T22:31:50.984Z热度 67

Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$...

论文研究Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。

Claude Opus 4.7 用 14 小时、$251 重写了约 16,000 行 Go 代码的生物信息学工具 gotree,而人类工程师预计需 2-17 周。 该基准单次运行最高花费 $2,600,AI 连续工作 19 天,目前 22/25 个目标程序已开源。

中文正文 · AI 翻译

近年来,AI在软件工程基准测试上取得了快速进展。然而,大多数此类基准测试往往专注于较短的任务,例如修复错误或实现单个功能。MirrorCode 是我们与 METR 共同开发的基准测试,用于测试 AI 模型在长周期编码任务中的表现。在 MirrorCode 任务中,AI 模型的任务是从头重实现整个程序,不得访问原始源代码。AI 生成的解决方案必须在端到端测试中(包括保留测试)完全匹配原程序的输出。MirrorCode 的 25 个目标程序涵盖不同的计算领域:Unix 工具、数据序列化与查询工具、生物信息学、解释器、静态分析、密码学及压缩。

关键是,我们提供了足够大的推理预算,以便对 MirrorCode 任务进行认真尝试。许多现有的软件工程基准测试将推理开支限制在约 1–10 美元,即使任务对人类来说需要几周时间才能完成。例如,MirrorCode 中最大的一项任务单次运行成本为 2,600 美元,AI 连续工作了 19 天,没有人工干预。

从头重实现整个程序对人类软件工程师来说极具挑战。我们相信,即使没有 AI 的帮助,人类工程师也需要数月时间才能完成最复杂的 MirrorCode 任务。然而,MirrorCode 任务也是可行的;我们知道这类任务的信息量足够,使其具有公平性。

我们对 AI 模型进行沙箱管理,要求它们在进行工作时无法访问互联网、无法访问原始代码库,且无法在任务中作弊。还有一些模型在开发代码时永远不会看到的端到端测试,因此它们不能简单地创建查找表来模拟原程序的输出。

尽管困难重重,AI 已经能够解决长周期的 MirrorCode 任务。例如,Claude Opus 4.7 成功重实现了 gotree:一个包含约 16,000 行 Go 代码和 40 多条命令的生物信息学工具包。我们认为,此任务没有 AI 辅助的人类工程师需要 2–17 周的时间,而 Opus 4.7 在 14 小时内完成,成本为 251 美元。

这些结果的一个重要警告是数据污染。因为MirrorCode任务涉及重新实现开源程序,AI模型在预训练中很可能已经见过原始代码库。这可能导致基准测试结果被高估。然而,AI成功重新实现了一些通过我们记忆筛选的目标程序,而在记忆筛选显示有记忆证据的程序上失败了。这表明结果并非完全由记忆主导,但我们不能排除记忆对AI性能有贡献的可能性。总体而言,我们预计MirrorCode测量的能力会推广到未见过的代码库。我们在论文中对此进行了进一步讨论,并提供了更多结果和基准构建细节:https://arxiv.org/pdf/2606.30182。

MirrorCode并未完全解决。在我们定期更新的排行榜中,我们报告MirrorCode (ML, +Private, 2L)。这意味着我们运行来自中大型类别的15个目标程序,并丢弃小型类别的程序。每个目标程序在两种实现语言中进行评估(通常是Go和Ada),共30个任务。我们对每个任务运行三次,每次尝试的预算为100亿个token和7天。

我们发布了我们的框架和25个MirrorCode目标程序中的22个(涵盖六种支持的编程语言,总计132个任务实例)作为开源:https://github.com/epoch-research/MirrorCode,其他三个目标保留作为私有测试集。

这项工作与METR共同开发,并由METR资助。MirrorCode的作者是Tom Adamczewski、David Owen 和 David Rein。Florian Brand、Giles Edkins、Allen Hart和Daniel O’Connell贡献了额外的目标程序。Rasmus Faber-Espensen在关键基础设施改进和工程建议方面提供了支持。

得分最高的AI gotree实现通过了2000/2001个测试,但在一个针对操作日期注释的冷门命令的边缘案例测试中失败。因此,它们并未严格达到100%的任务完成度,但我们认为重新实现几乎完美,涵盖了基本上所有的功能范围。

请参阅论文中“建议命名规范”的定义。“+Private”表示包含私有测试集:这里指 private_M 和 private_L,即中等和大型类别中的私有目标。在 2L 映射下,目标程序通常使用 Go 和 Ada(一种主流语言和一种低资源语言),有两个例外。这些分数与论文中的分数不可直接比较,论文评估了所有 25 个目标程序,在 Small 和 Medium 类别中使用了所有 6 种代理实现语言,并为尝试分配了 10 亿个 token 的预算(大型目标除外),且没有时间限制。:#user-content-fnref-2

Epoch AI 的作品可以自由使用、分发和复制,但必须在署名的情况下遵循知识共享署名许可协议:https://creativecommons.org/licenses/by/4.0/。

在收件箱中获取 Epoch AI 的最新信息

有问题吗?发现了错误?请告诉我们。

如果您希望收到回复,请提供您的姓名和电子邮件地址。

MirrorCode 是 Epoch AI 的长期编码基准测试:AI 可以从头到尾重新实现整个程序,而无需访问原始源代码。

情报判断

Aioga 编辑摘要

MirrorCode 由 Anthropic 与 METR 联合推出,用于测试 AI 在无源码、无联网条件下端到端重写完整程序的能力,并通过包含隐藏用例的端到端测试核对输出。25 个目标程序覆盖多类计算领域。

背景分析

现有软件工程基准多聚焦修复缺陷或实现单项功能,且推理预算通常约为 1 至 10 美元。MirrorCode 转向长周期任务,允许更高预算;其中一次大型运行花费 2600 美元,AI 在无人干预下工作 19 天。

Aioga 观点

Aioga 判断,MirrorCode 的价值在于把评估对象从局部代码修改扩展到完整程序复现,并设置沙箱、隐藏测试与较长运行预算。不过开源代码可能进入预训练数据,研究方也明确表示无法排除记忆对成绩的贡献。

影响与后续

Claude Opus 4.7 在 14 小时内以 251 美元重写约 1.6 万行 Go、包含 40 多个命令的 gotree;研究方估计人类工程师不用 AI 需 2 至 17 周。值得关注的是,该结果仅代表特定任务与测试条件,基准尚未被完全解决。 后续可关注定期更新的排行榜、私有测试集表现,以及通过记忆筛查的目标程序能否持续复现当前结果。项目已开放脚手架和 25 个目标程序中的 22 个,其余 3 个保留为私有测试集。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: epoch.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-04T22:31:50.984Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-04T22:31:50.984Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。