Aioga
AI资讯 / 行业动态
返回 AI资讯

Sierra 开源 hyper-τ-bench:评估能构建智能体的智能体

Sierra:Blog(RSS)Aioga 编辑团队2026-09-08T20:25:11.000Z热度 58

Sierra 今日开源 hyper-τ-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于"构建智能体的智能体"...

行业动态Sierra:Blog(RSS)

今日 AI 情报摘要

Sierra 今日开源 hyper-τ-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。

该基准聚焦于"构建智能体的智能体"这一任务场景,为长时程自主智能体开发提供评测标准。

中文正文 · AI 翻译

获取有关新产品功能、客户更新等的通知。

Headshot of Ben Shi
Headshot of Keshav Dhandhania

我们在 2024 年构建了𝜏-bench:https://sierra.ai/blog/benchmarking-ai-agents 来回答一个当时感觉很新颖的问题:模型能否充当可靠的客户服务代理?这就是现在的赌注。更难的问题是,谁首先构建代理?越来越多的是模型本身。

我们与一些世界领先的公司紧密合作,以推出他们的代理。在实践中,这项工作不像执行规范,更像是在做研究。需求分散在手册、支持文档、电子表格以及你最优秀的前线员工的脑海中——所以你提出假设,寻找证据,并构建和测试,以确定哪些杠杆实际上能提升性能。

今天我们开源了hyper-𝜏-bench(以𝜏^𝜏-bench发布),这是一个新的长期视角代理评估,它衡量模型不仅能作为代理工作,还能构建代理的能力。

Hyper-𝜏-bench将开发者代理放入一个沙箱工作区,里面有模拟业务的记录,以及一个随时可以消息的模拟客户。然后,开发者代理从头到尾完成工作——从证据中恢复规范,设计架构,并将业务操作转化为工具——直到拥有一个可用的客服代理。客户的REST API可能存在微小缺陷,所以部分工作是判断是规范的问题还是代码的问题。完成的代理必须在每次对话的成本预算内,从固定的模型菜单中提供服务。一旦交付,我们会使用开发者构建过程中未见过的、完全可验证的𝜏-bench式测试,将其部署到模拟生产流量中。

单独工作时,我们的最佳配置——运行Claude Code的Claude Opus 5(最大推理)——仅通过23.9%的保留评估任务。与具有深厚背景知识的工程师配对时,相同类别的模型在相同任务中可达到82.2%。

我们阅读了开发者的轨迹,以查看他们的构建在哪些地方失分。有五种模式显著突出:

Hyper-𝜏-bench 与 MLE-bench 和 RE-Bench 等评测基准并列,这些基准衡量研究能力:设计实验、权衡利弊以及迭代以改进系统。构建一个智能体要求具备所有这些能力——并且额外增加一些自己的问题。规范必须从文档和人员中获取。而且因为正在构建的系统本身就是一个 AI,唯一能够判断设计是否有效的方法就是运行它,并读取它对真实用户的输出,而开发者在构建过程中从未见过这些用户。

𝜏-bench 关注模型是否可以成为优秀的智能体。Hyper-𝜏-bench 则关注它们是否能构建智能体。随着智能体越来越多地承担这些工作,我们将继续使用 hyper-𝜏-bench 来追踪它们的表现。

论文:https://arxiv.org/abs/2609.04611 | 代码库:https://github.com/sierra-research/hyper-tau-bench | 排行榜:https://sierra-research.github.io/hyper-tau-bench/

了解 Sierra 如何帮助你用 AI 实现更好的成果。

The text "τ³-Bench" on a blurry, grainy background of green and brown.

𝜏³-Bench 已经到来。我们将智能体评估扩展到了两个新前沿:知识检索和语音。

𝜏²-bench

𝜏²-bench 不仅要求 AI 智能体进行推理和行动,还要求它们协调、指导并协助用户实现共同目标。从单独操作到任务共管,这一跃迁将智能体推向了更具挑战性的领域。而且,关键是,它反映了现实世界中 AI 智能体越来越多被要求执行的任务类型。

𝜏-bench

我们探讨 Sierra 的 𝜏-bench 如何影响智能体的开发和评估——从学术研究到行业应用及下一代开发。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Sierra 今日开源 hyper-τ-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: sierra.ai

来源: Sierra:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-08T20:25:11.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Sierra 今日开源 hyper-τ-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于"构建智能体的智能体"...

Sierra:Blog(RSS)2026-09-08T20:25:11.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。