Aioga
AI资讯 / 行业动态
返回 AI资讯

Real-SWE 发布:在企业私有真实代码库上评测前沿编程模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-13T01:18:53.000Z热度 58

Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。

中文正文 · AI 翻译

在私有、真实世界的企业代码库上对前沿 AI 模型进行基准测试。

今天我们发布了 Real-SWE,这是一个在私有、真实世界的企业代码库上评估前沿 AI 模型的基准。每个任务都来自我们从真实公司许可的私有生产代码库。这些是他们工程师正在处理的问题,具有现有产品所带来的所有上下文和复杂性。

在现实世界中,编码代理真的能替代软件工程师的工作吗?

Real-SWE 发布:在企业私有真实代码库上评测前沿编程模型

专家生成的或合成的任务可以设计得很好,但它们并不是工程师在真实公司中需要完成的逐字实际任务。我们的任务在两个方面有所不同:基础代码工件和指令的具体性。这两者都增加了挑战当今前沿模型的复杂性。

我们使用本地测试环境来反映企业工程师的实际工作方式,评估模型和测试环境的组合,而不是单独评估模型。

修复发票计费,使每个业务收取正确的税款,并确保免税客户不被征税。

计费将在周一重新开启,本服务发出的每张发票都会没有税款。平台上的每个业务以不同方式结算税款:有些自行维护税率,有些希望每张发票根据买方所在地由我们的税务提供者定价,还有些不收取任何税款,而对于我们持有免税资格的客户,无论业务配置如何,都不收取费用。为目的地定价意味着根据业务所在账户,向税务机关提供双方地址、定价项目以及业务销售的产品类别,在沙箱或生产税务环境中进行;税务机关拒绝的地址必须报告,但不能阻止发票开具。税率、税金和总额必须出现在已开具的发票上,一旦发票结算,销售额会根据该发票号回报给税务机关,以便汇总申报。欧洲双方之间的发票显示双方的增值税登记号码。税务机关和账簿可在 TAX_JAR_URL、PROD_TAX_JAR_URL 和 INFLUX_URL 查阅。

Real-SWE 任务环境中的工具和服务。每个任务仅公开其工作流所需的服务。

我们通过严格的筛选过程选择了代码库,重点关注那些拥有大量使用、强大工程团队和高强度生产工作负载的真实公司。下面分析的样本任务来自这些代码库,包括:

我们优先考虑为满足实际用户或业务需求而编写的代码,而不是仅为了创建基准任务而编写的代码。生产工程需要理解现有架构,保留用户依赖的行为,并在真实操作约束下进行更改。

我们的任务描述所需的更改,留给代理去发现代码库及相关工具中的实现细节。验证者要求的任何行为必须明确说明或可以合理地发现。这使我们的提示略显不完全明确,与 DeepSWE 和 Terminal Bench 相当,但足够具体,不会遗漏指令。

这项工作是跨职能且复杂的:单一更改可能涉及应用程序的多个部分。代理必须理解现有业务逻辑和公司编码模式,同时保持周围系统的正常运行。

一次典型的真实SWE指令是1,742个字符。

Real-SWE 中有 11 个文件,相比之下 FrontierCode 和 DeepSWE 有 6 个文件。

71.4% 的 10 分钟以内的部署失败,而较长时间部署失败率为 73.4%。

在充满现有业务逻辑和编码模式的代码库中,对多个系统进行分类和理解需求是困难的。

每个任务都源自或直接摘自私有的真实世界代码库。我们发现这类任务非常有趣,原因有三:

以下是我们基准中的一小部分任务分析。如果您对样本感兴趣,请在这里申请访问:/benchmarks/real-swe/request-access。

选择任务以查看模型结果。百分比显示整体解决率。

失败按提交行为进行分组,使用跨模型的相同分类法,遵循 DeepSWE:https://arxiv.org/html/2607.07946v1#A3。

每次部署一个方格:每行代表一个任务,每列代表一次试验,每个任务的每个模型有八次试验。

百分比基于每个模型的失败运行,而不是所有运行。

建立在对系统的猜测上,而不是在工作区中进行检查。

遗漏指令要求的行为。

思路正确,但与周围系统的连接不正确。

在进行更改时破坏了现有行为。

将更改交付到运行的应用程序从未调用的地方,例如一次性脚本。

每个代理都在隔离的沙箱中运行。所有任务都是 Harbor 格式,验证器在评分时注入。验证器的灵感来自代码库中现有的测试套件,或者按原样使用这些测试。

情报判断

Aioga 编辑摘要

Specific 发布 Real-SWE 基准,使用经真实公司授权的私有生产代码库任务评测前沿 AI 模型。标题显示,当前最高解决率为 38.8%。

背景分析

该基准强调任务来自真实企业生产代码库,并保留现有产品中的上下文与复杂性。评测采用原生 harness,考察模型与 harness 的组合,而非只单独比较模型。

Aioga 观点

Aioga 判断:Real-SWE 的核心价值在于把评测对象从设计或合成任务,推进到来源于实际生产代码库的具体工程问题;但其结果仍应结合任务与环境理解。

影响与后续

可能影响:企业代码任务的评测结果可能更能反映特定工作流中的表现,但单一基准不足以代表模型能够完成所有软件工程工作;比较时需要关注任务、代码库和 harness 条件。 后续观察:应关注 Real-SWE 后续披露的任务覆盖范围、评分细节及不同模型与 harness 组合的结果,以判断 38.8% 解决率的适用边界。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: withspecific.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-13T01:18:53.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。

Hacker News 热门(buzzing.cc 中文翻译)2026-09-13T01:18:53.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。