Aioga
AI资讯 / 行业动态
返回 AI资讯

Google 员工分享如何设计可信的 AI 评测的五条规则

Google AI:DEV 作者专属(RSS)Aioga 编辑团队2026-09-01T16:35:00.000Z热度 58

Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主...

行业动态Google AI:DEV 作者专属(RSS)

今日 AI 情报摘要

Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills

设计评测的方法,主张像写单元测试一样建立结构化、自动化的评测流程,而非在终端做 vibe testing。

中文正文 · AI 翻译

作为我在谷歌工作的一部分,我们在 GitHub 上发布了一套针对谷歌产品和技术的代理技能:https://github.com/google/skills。这些代理技能:https://agentskills.io/home 旨在帮助 AI 代理与我们的技术进行交互。但你如何测试这些技能是否有用并按预期工作呢?我在开发者关系团队一直专注于这个问题,因为拥有关于它们性能的可靠信号对于帮助我们随着时间改进这些技能至关重要。

正如你不会在没有编写单元测试的情况下部署生产 API 一样,你也应该对 AI 代理应用同样的标准。正如 Joe Spiro 在“设计 AI 评估”系列文章中展示的:https://dev.to/googleai/designing-ai-evals-clarity-now-and-visualization-next-4eii,扩展 AI 工具意味着要超越在终端中“凭感觉测试”。相反,你应该建立一个结构化的、自动化的评估管道来基准测试你的集成。评估(evals)是你要求代理执行的动作,这些动作使用评分器(例如评分标准)评分,以判断代理是否成功。本文将重点介绍评估,并在下一篇文章中讨论评分标准的技巧。

然而,AI 评估需要消耗真实的代币。你需要确保尽可能高效地使用这些代币。它们需要提供真正的价值,帮助你构建更好的工具。编写好的评估至关重要。糟糕的评估会提供错误信号,浪费你的代币预算,并在指标中产生噪音。

以下是我们学到的五条设计更可靠评估规则。遵循它们可以确保你花费的每一个代币都产生有用的指标。

在编写评估之前,你需要了解所选框架的设置和限制。这包括 Harbor、Inspect AI 等系统,或在开发工具中的集成,如代理开发工具包中的集成:https://docs.cloud.google.com/gemini-enterprise-agent-platform/optimize/evaluation/agent-evaluation。它是否使用临时沙箱?有哪些可用工具?如何捕获输出?

如果你的评估显示出较高的基线准确率(即没有你的代理工具时),可能无法证明它的价值,或者评估提示过于简单。

你不能根据你没有明确要求代理完成的事情来对其打分。你的评估提示和评分者应该是互补的。这意味着它们只应该测试提示中包含的内容。

代理具有固有的模型知识,可能会完全跳过你的自定义工具来得出正确答案。(这本身就是一些有用的反馈!)

强大的评估套件测试真实、多样化的用例。但重复测试相同的能力会导致过拟合并产生噪音指标。

如果你不能准确衡量 AI 工具,就无法改进它们。如果你像对待传统单元测试一样关注 AI 评估,你将提高指标的质量并获得更稳健的信号。

通过应用这五条规则,你可以消除浪费令牌预算的虚假信号。你的测试套件将不再产生噪音,而是提供可行的反馈,用于指导你的工程决策并改进工具。

确定测试内容只是第一步。只有当评分答案的评分者可靠并返回有意义的结果时,精心设计的评估才有用。在我的下一篇文章中,我们将探讨如何测试。你将学习如何编写精简、原子化的评分标准,最大限度地减少 LLM 评分者的歧义,让每个令牌都发挥作用。

照片由 William Warby 拍摄:https://unsplash.com/@wwarby,来自 Unsplash:https://unsplash.com/photos/gray-and-yellow-measures-WahfNoqbYnM

pic

模板让你可以快速回答常见问题或存储片段以便重复使用。

你确定要隐藏这条评论吗?它将在你的帖子中被隐藏,但仍可通过评论的永久链接查看:#。

如需进一步操作,你可以考虑屏蔽此人和/或举报滥用:/report-abuse

Google AI Studio 是使用 Gemini 开始构建的最快方式。准备好开始了吗?

DEV Community:/ — 一个讨论、跟进软件开发并管理软件职业的空间

基于 Forem 构建:https://www.forem.com — 开源软件:https://dev.to/t/opensource,支持 DEV:https://dev.to 及其他包容性社区。

用爱和 Ruby on Rails 制作:https://dev.to/t/rails。DEV 社区 © 2016 - 2026。

我们是一个程序员分享、保持最新信息并发展职业的地方。

Google 员工分享如何设计可信的 AI 评测的五条规则
Google 员工分享如何设计可信的 AI 评测的五条规则

情报判断

Aioga 编辑摘要

Google Developer Relations 团队成员 Jan-Felix Schmakeit 分享了为 Google 产品 Agent Skills 设计 AI 评测的方法,主张建立类似单元测试的结构化、自动化流程,减少在终端进行“凭感觉测试”。

背景分析

Google 正在发布面向其产品和技术的 Agent Skills。文章将评测定义为要求代理完成的行动,并通过评分器判断是否成功,同时提醒评测会消耗真实 token,设计不当可能产生错误信号和指标噪声。

Aioga 观点

Aioga 判断:文章的核心价值在于把代理评测从一次性体验判断转向可重复的测试流程,但评测结果仍取决于框架限制、任务难度、提示与评分标准是否匹配。

影响与后续

可能影响:采用代理评测的团队需要先确认沙盒、可用工具和输出捕获方式,并检查基础准确率是否过高、任务是否过易;高分不代表自定义工具一定被使用,也不足以单独证明代理工具的价值。 后续观察:应关注文章后续关于评分量规的讨论,以及 Google Agent Skills 评测流程如何处理工具调用、输出捕获和基线结果等问题。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: dev.to

来源: Google AI:DEV 作者专属(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T16:35:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主...

Google AI:DEV 作者专属(RSS)2026-09-01T16:35:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。