Aioga
AI资讯 / 行业动态
返回 AI资讯

Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI:DEV 作者专属(RSS)Aioga 编辑团队2026-09-02T16:35:00.000Z热度 72

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题...

行业动态Google AI:DEV 作者专属(RSS)

今日 AI 情报摘要

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。

文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

中文正文 · AI 翻译

跟进第一部分:如何设计你实际上可以信任的 AI 评估:https://dev.to/googleai/how-to-design-ai-evaluations-you-can-actually-trust-41c3

在 Google,我们正在 GitHub 上发布一系列适用于 Google 产品和技术的 Agent 技能:https://github.com/google/skills。我的团队有兴趣衡量它们的性能,以了解它们的表现情况。确定性的测试,比如检查生成的代码是否能编译,是理想的。不幸的是,对于细微的生成式响应(例如对开放性问题的回答或信息检索任务)来说,它们无法轻松大规模创建。

在我上一篇文章中,我们研究了你测试的内容:https://dev.to/googleai/how-to-design-ai-evaluations-you-can-actually-trust-41c3,这意味着评估是你要求代理执行的操作。下一步是看看你如何断定代理是否成功。这意味着需要创建对代理响应的可靠且准确的评估。

为了大规模评估复杂输出,尤其是当主题涉及广泛领域且包含细微部分时,我们使用“以大型语言模型(LLM)作为裁判”的方法。响应将根据结构化评分标准由模型评分器评估。裁判使用一组是/否问题来评估每个响应。汇总这些答案会为响应提供准确率分数。

给 LLM 提供模糊提示或主观问题会导致其响应出现不确定性。这种不确定性会引入噪声数据,导致评估不一致。最终,它会浪费你的代币预算在没有用处的指标上。

为了使这些评估更可靠,你必须将评分标准视为正式规范。通过将裁判限制为评估严格的、客观的布尔真值,你可以降低幻觉的可能性。由于评估严格布尔真值的任务较为简单,你甚至可以使用更小、更快的模型进行评分。

以下是我们学到的四条经验,帮助你为 LLM 作为裁判的评分器撰写稳健的评分标准问题。

在单个问题中评估多个要求,例如“响应是否包含元数据属性并将输出格式化为 JSON?”会迫使 LLM 裁判猜测哪个子句更重要。这种模糊性会导致评分不一致并浪费代币。

基于评分标准的方法存在的原因是,如果给一个大语言模型作为评审者一个完整的散文提示来评估复杂的回答,会导致评分结果不一致。如果您问评审者主观性问题,比如“这是一个全面的答案吗?”或者让它解释“为什么代理会这样做?”,就会引入模糊性,从而产生嘈杂、不具重复性的数据。

在建立评分标准时,很容易不小心在提示中未提出的要求上评估代理。这样会产生假阴性,降低测量的准确性。

即使您遵循这些规则并编写完美的、原子化的、客观的问题,您的大语言模型评审者仍可能误解您的评分说明和评分标准。为了保证您的流程生成一致的评分和可靠的信号,您必须通过校准证明评审者的评分与人类主题专家对完全相同回答的评估一致。

一旦您拥有这些可靠的数据,下一步就是让其可见。在《AI Evals at a Glance: Heatmaps for Stakeholders》中:https://dev.to/googleai/ai-evals-at-a-glance-heatmaps-for-stakeholders-2mki,Joe Spiro 讲解了如何将这些原始测量数据可视化为评估结果。

在构建我们的代理技能时,我们了解到,模糊的评估评分标准无法提供有用的信号和反馈。强迫大语言模型评审者评估严格的布尔事实可以消除这些噪声。它使测试可重复,优化令牌消耗,并让您能够自信地衡量您的 AI 工具是否真正提升了性能。

照片由 William Warby 拍摄:https://unsplash.com/@wwarby,来自 Unsplash:https://unsplash.com/photos/gray-and-yellow-measures-WahfNoqbYnM

pic

模板让您能够快速回答常见问题或存储可重复使用的片段。

您确定要隐藏此评论吗?它会在您的帖子中隐藏,但通过评论的永久链接仍可见:#。

对于进一步操作,您可以考虑屏蔽此人和/或举报滥用行为:/report-abuse

Google AI Studio 是开始构建 Gemini 的最快方式。准备好开始了吗?

DEV 社区:/ — 一个用于讨论、追踪软件开发并管理软件职业的平台

构建于 Forem:https://www.forem.com — 这个开源软件:https://dev.to/t/opensource 支撑着 DEV:https://dev.to 以及其他包容性社区。

用爱和 Ruby on Rails 制作:https://dev.to/t/rails。DEV 社区 © 2016 - 2026。

我们是一个程序员分享、保持更新并发展职业的平台。

Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

情报判断

Aioga 编辑摘要

Google AI 团队发布教程,介绍如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准。教程指出,模糊提示可能造成评估不一致并浪费 token,并总结了四条编写经验。

背景分析

文章称,确定性测试适合检查代码是否编译,但开放式问答和信息检索等细腻的生成式响应难以大规模测试,因此采用模型评判器依据结构化评分标准,以一组真或假问题评估响应。

Aioga 观点

Aioga 判断:将评分标准视为形式化规格,有助于把评测要求拆解为更明确的客观判断,但可靠性仍取决于问题设计和校准过程。

影响与后续

可能影响:原子化、互不重叠且只覆盖明确要求的评分问题,可能减少歧义;但这不代表模型评判天然等同于人工评分,仍需要专家标注的 golden set 校准。 后续观察:应关注相关评分标准是否落实四条经验,以及评判模型经过专家标注集校准后,能否与人类评分保持一致。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: dev.to

来源: Google AI:DEV 作者专属(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T16:35:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题...

Google AI:DEV 作者专属(RSS)2026-09-02T16:35:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。