Aioga
AI资讯 / 行业动态
返回 AI资讯

Google 详解 Harness 工程:如何评估、迭代和守护 AI 编码智能体

Google Developers Blog(RSS)Aioga 编辑团队2026-09-09T16:59:39.000Z热度 58

Google 开发者博客发文介绍行为评估(behavioral evals)方法,主张不再把智能体当黑盒考试,而是对中间执行步骤(如工具调用、是否先跑验证器)写断言,作为端到端...

行业动态Google Developers Blog(RSS)

今日 AI 情报摘要

Google 开发者博客发文介绍行为评估(behavioral evals)方法,主张不再把智能体当黑盒考试,而是对中间执行步骤(如工具调用、是否先跑验证器)写断言,作为端到端基准如

Terminal-Bench 的补充。

中文正文 · AI 翻译

当开发人员第一次开始为具代理性的编码系统进行工具开发时,他们经常会陷入同一个陷阱:他们运行像 Terminal-Bench 和 DeepSWE 这样的常见端到端基准,看到综合得分变化了几个百分点,但根本不知道为什么会变化。

Google for Developers

端到端基准实际上是评估模型性能和确定哪些方面需要深入调查的标准方法,但问题在于这些调查的成本很高。

行为评估通常是更好的方法,它可以衡量你期望的行为是否真正发生,以及你是在朝正确方向前进还是由于回退或新模型变更而退步。它们可以作为你的迭代伙伴,帮助你洞察为什么某些变化会以某种方式影响结果。

这是我们对行为评估的看法,包括帮助我们在模型演化时保持代理系统可靠的方法。

大多数团队评估 AI 代理的方式就像评估一个参加考试的学生。他们交给代理一个庞大的代码库,给它一个时间限制,并根据有多少测试通过或失败来衡量其成功。

当得分下降时,到底哪里出了问题?

端到端基准通常不能直接回答这些问题。

行为评估的功能类似于提高代理工具操作的集成测试。当你拥有足够丰富的行为评估集时,你就有了针对代理目标行为的基线,并且可以迭代改进提示以达到目标。

行为评估不是衡量代理是否完成了整个多文件重构,而是衡量离散、可观察的动作:

Screenshot 2026-09-09 at 9.34.40 AM

不要在第一天就建立复杂的评估工具,而是利用这段时间跟随你的直觉并进行实验。

在从零开始引导一个代理时,你首先依靠开发者的直觉和自我测试。除非你已经构建了一个能够测试自身代码库、处理样板代码、编写自己的 Markdown 渲染器并执行常规开发任务的代理,否则运行评估没有意义。

评估属于开发的第二阶段:确保前进并防止回退。

评估套件的主要目的是不是为了在你让代理提升2%时庆祝;而是为了让你对新的提示调整、工具模式更改或模型升级没有整体上使代理变得更差有不可动摇的信心。

一个健壮的评估框架将行为断言分解为快速、确定性、类单元的检查,可在本地运行。

将你的注意力转向这些更小、可观察的动作会创建可靠的安全网。你可以自信地迭代你的系统提示或切换到不同的模型,因为你会立即知道是否不小心破坏了核心行为。

行为评估关注中间执行步骤,例如特定的工具调用或文件修改,而不是最终字符串的相等性:

借助丰富的行为评估套件,你可以自动化你的提示工程。例如,你可以设置一个循环,让大型语言模型调整自己的系统提示,迭代直到失败的测试最终通过,同时你的其余测试套件表现得类似于 CI/CD 风格的护栏运作。这有助于确保更改不会破坏任何现有功能。

从一开始,你可以做一些事情来让这个过程可重复。我建议你从一个三步行为测试循环开始:

你的代理不需要更高的基准分数就可以开始。它需要的是一个保持诚实的评估框架。

要构建一个稳定、具有弹性的评估工具,你必须停止将模型当作一个参加期末考试的黑箱来看待,而是开始将你的评估框架当作需要单元测试和集成测试的标准软件来处理。

虽然行为评估是评估框架工程的核心支柱,但它们不能替代更大规模的端到端评估套件。它们实际上是互补的。宏观基准验证最终目标,而微观行为评估作为伙伴,支持安全、快速的迭代。当你采用两者时,你在迭代时(如修改提示、开发新功能或部署全新模型)会有更高的信心水平。

宣布 Kotlin 版 ADK 1.0:在 Kotlin、Android 及更多平台构建生产就绪的 AI 代理

How to Evaluate Live & Voice Agents in ADK

如何在 ADK 中评估实时和语音代理

Driving Developer Excellence: Inside the Program Sprints

推动开发者卓越:深入了解项目冲刺

情报判断

Aioga 编辑摘要

Google 开发者博客介绍用于 AI 编码智能体的行为评估方法,建议在端到端基准之外,对工具调用、是否先运行验证器等中间执行步骤编写断言,以判断目标行为是否发生,并识别回归。

背景分析

文章指出,团队通常通过 Terminal-Bench、DeepSWE 等端到端基准和测试通过情况评估智能体,但综合分数变化通常难以直接解释原因。行为评估被描述为改进智能体运行机制的集成测试。

Aioga 观点

Aioga 判断:这套方法的核心价值在于把“结果是否正确”进一步拆解为“过程是否符合预期”,从而为提示词迭代和模型变化后的回归检查提供更具体的观察依据。

影响与后续

可能影响:评估体系可能需要同时覆盖端到端结果与关键行为断言;单一综合分数不足以解释性能变化,也不代表智能体的执行过程可靠。团队应根据预期行为建立可重复的基线。 后续观察:需要关注 Google 是否披露更完整的行为评估案例、断言设计方式及其与现有基准的结合效果,并观察该方法能否稳定识别模型或提示词变化带来的回归。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: developers.googleblog.com

来源: Google Developers Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-09T16:59:39.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 开发者博客发文介绍行为评估(behavioral evals)方法,主张不再把智能体当黑盒考试,而是对中间执行步骤(如工具调用、是否先跑验证器)写断言,作为端到端...

Google Developers Blog(RSS)2026-09-09T16:59:39.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。