Aioga
AI资讯 / 技巧观点
返回 AI资讯

LangChain 发布 Deep Agents 新基准评测方案

LangChain:Blog(RSS)Aioga 编辑团队2026-07-24T02:31:15.000Z热度 47

LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。该评测方案用于指导 Deep Ag...

技巧观点LangChain:Blog(RSS)

今日 AI 情报摘要

LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。

该评测方案用于指导 Deep Agents 的版本迭代与变更发布。

中文正文 · AI 翻译

代理设计很难,很大程度上是因为代理的评估也很难。当我们开发 Deep Agents——我们的开源、模型无关的代理框架——时,我们不断面临许多决策:如何提示、包含哪些工具、包含哪些中间件等。在迭代过程中,我们希望拥有一套稳健的评估集合来衡量我们的决策。我们最近重新设计了评估框架,在这篇博客中,我们将分享我们如何看待 Deep Agents 的评估。

我们最近的评估工作集中在确定一组端到端评估。之前,我们有较小的“单元”式测试。我们仍然保留这些测试,但随着代理任务运行时间越来越长,我们转向了更多的端到端评估。

为此,我们使用了 Harbor:https://www.langchain.com/blog/unified-stack-for-evaluating-agents 作为评估运行器。Harbor 是一个流行的开源框架,用于运行代理评估,以支持 Terminal Bench(一个领先的编码基准)而闻名。

使用 Harbor 时,你需要提供三个内容:

每个数据集(https://www.harborframework.com/docs/core-concepts#dataset)都有任务(https://www.harborframework.com/docs/core-concepts#task),其组成部分包括:

与简单的 LLM 评估相比,有两个主要区别:

目前我们运行三个基准测试,每个测试涵盖不同类型的代理工作。Deep Agents 是一个通用框架,因此我们需要在多个不同领域中基准其能力。

这只是一个开始——我们会随着时间增长这些任务集合。

我们使用这些基准测试来自信地进行迭代。当我们做出决策时,基准测试的变化让我们有信心朝着正确的方向前进。

一个具体的例子是我们如何使用它为 Deep Agents 0.7 发布做准备。作为该版本的一部分,我们希望精简框架,并移除曾经必要但现在不再需要的提示。这对使用 Deep Agents 的人来说是有好处的:每次运行的 token 数更少,模型可以将更多注意力集中在他们编写的指令上。

我们正在考虑的两个具体变化:移除待办事项中间件,以及显著精简系统提示。我们正在使用这个基准来帮助决定这些包含项对于代理工具是否仍然必要。

LangSmith,我们的代理工程平台,可以帮助开发者调试每个代理决策、评估变更,并一键部署。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: langchain.com

来源: LangChain:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-24T02:31:15.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

LangChain 重新设计了 Deep Agents 的基准评测方式,并在 Harbor 平台上运行覆盖编码、对话和检索三类任务的评估流程。该评测方案用于指导 Deep Ag...

LangChain:Blog(RSS)2026-07-24T02:31:15.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。