{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-09-28T06:03:00.468Z","headline":"Google 详解 Harness 工程：如何评估、迭代和守护 AI 编码智能体","description":"Google 开发者博客发文介绍行为评估（behavioral evals）方法，主张不再把智能体当黑盒考试，而是对中间执行步骤（如工具调用、是否先跑验证器）写断言，作为端到端基准如 Terminal-Bench 的补充。","url":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","mainEntityOfPage":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","datePublished":"2026-09-09T16:59:39.000Z","dateModified":"2026-09-09T16:59:39.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents","https://aihot.news/items/cmtuchdoo175orofpg9odx9p2"],"canonicalUrl":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","directAnswer":{"@type":"Answer","text":"Google 开发者博客介绍用于 AI 编码智能体的行为评估方法，建议在端到端基准之外，对工具调用、是否先运行验证器等中间执行步骤编写断言，以判断目标行为是否发生，并识别回归。","url":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","dateCreated":"2026-09-09T16:59:39.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"developers.googleblog.com source article","url":"https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents","datePublished":"2026-09-09T16:59:39.000Z","provider":{"@type":"Organization","name":"developers.googleblog.com","url":"https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.news/items/cmtuchdoo175orofpg9odx9p2","datePublished":"2026-09-09T16:59:39.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.news/items/cmtuchdoo175orofpg9odx9p2"}}],"aggregationSource":"Google Developers Blog（RSS）","originalPublisher":{"name":"developers.googleblog.com","url":"https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents"},"geoDeepAnswer":null,"article":{"id":"cmtuchdoo175orofpg9odx9p2","slug":"cmtuchdoo175orofpg9odx9p2","url":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","title":"Google 详解 Harness 工程：如何评估、迭代和守护 AI 编码智能体","title_en":"","summary":"Google 开发者博客发文介绍行为评估（behavioral evals）方法，主张不再把智能体当黑盒考试，而是对中间执行步骤（如工具调用、是否先跑验证器）写断言，作为端到端基准如 Terminal-Bench 的补充。","source":"Google Developers Blog（RSS）","sourceUrl":"https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents","aiHotUrl":"https://aihot.news/items/cmtuchdoo175orofpg9odx9p2","publishedAt":"2026-09-09T16:59:39.000Z","category":"行业动态","score":58,"selected":false,"articleBody":["When developers first work on harness engineering for agentic coding systems, they often fall into the same trap: they run common end-to-end benchmarks like Terminal-Bench and DeepSWE, watch a composite score move by a few percentage points, and have no idea why it changed.","End-to-end benchmarks are the de facto for evaluating model performance and determining what needs deeper investigation, but the challenge is that those investigations come at a high cost.","Behavioral evaluations are often a better measure of confidence on whether the behaviors you expect actually do happen and whether you’re moving in the right direction instead of backsliding when it comes to regressions or new model changes. They can serve as your iteration partner and help give insight into why certain changes move the needle in one way or another.","Here’s our take on behavioral evaluation, including approaches that have helped us keep agent systems reliable as models evolve.","Most teams evaluate AI agents like they would evaluate a student taking an exam. They hand the agent a large codebase, give it a time limit, and measure its success based on how many tests pass or fail.","When that score drops, what went wrong?","End-to-end benchmarks don’t typically directly answer these questions.","Behavioral evaluations function like integration tests for improving agent harness operation. When you have a rich enough behavioral eval set, you have a baseline for the behavior you're targeting from your agent, and you're able to iteratively improve the prompt to get there.","Instead of measuring whether the agent solved an entire multi-file refactor, a behavioral eval measures discrete, observable actions:","Instead of setting up a complex evaluation harness on day one, use this time to follow your hunches and run experiments.","When bootstrapping an agent from scratch, you start with developer instinct and dogfooding . Until you have built an agent capable of dogfooding its own codebase, handling boilerplate, writing its own markdown renderer, and executing routine developer tasks, it doesn’t make sense to run evaluations.","Evals belong to the second phase of development: ensuring forward progress and guarding against regressions .","The primary purpose of an evaluation suite is not to celebrate when you make the agent 2% better; it is to give you unshakeable confidence that a new prompt tweak, tool schema change, or model upgrade did not make the agent holistically worse .","A robust harness evaluation framework separates behavioral assertions into fast, deterministic, unit-style checks that run locally.","Shifting your focus to these smaller, observable actions creates a reliable safety net. You can confidently iterate on your system prompts or switch to a different model, because you’ll know immediately if you've accidentally broken a core behavior.","Behavioral evals assert on intermediate execution steps, like specific tool calls or file modifications, instead of final string equality:","With a rich suite of behavioral evals, you can automate your prompt engineering. For example, you can set up a loop where an LLM tweaks its own system prompt, iterating until a failing test finally passes, all while the rest of your test suite acts similar to how a CI/CD-style guardrail operates. This helps you ensure that the changes don’t break any existing features.","There are a few things you can do from the start to make this process repeatable. I suggest you start small with a three-step behavioral testing loop:","Your agent doesn't need a higher benchmark score to get started. It needs an evaluation harness that keeps it honest.","To build a stable, resilient harness, you have to stop treating your model like a black box passing a final exam, and start treating your harness like standard software that requires unit and integration testing.","While behavioral evaluations are a core pillar of harness engineering, they aren’t a replacement for larger, end-to-end evaluation suites. They’re actually complementary. Macro benchmarks verify the final destination and micro behavioral evals serve as a partner that enables safe, rapid iteration. When you adopt both, you'll have higher confidence levels when iterating, like when making prompt changes, building out new features, or even deploying brand-new models.","Announcing ADK for Kotlin 1.0: Building Production-Ready AI Agents in Kotlin, Android, and Beyond","How to Evaluate Live & Voice Agents in ADK","Driving Developer Excellence: Inside the Program Sprints"],"articleImages":[{"sourceUrl":"https://storage.googleapis.com/gweb-developer-goog-blog-cms-assets/site/20260817-205152/images/g-dev.svg","alt":"Google for Developers","afterParagraph":0,"url":"/media/articles/cmtuchdoo175orofpg9odx9p2/22ba16a4694e57e6.jpg"},{"sourceUrl":"https://storage.googleapis.com/gweb-developer-goog-blog-assets/images/Screenshot_2026-09-09_at_9.34.40AM.original.png","alt":"Screenshot 2026-09-09 at 9.34.40 AM","afterParagraph":8,"url":"/media/articles/cmtuchdoo175orofpg9odx9p2/a4fe40e62eb5a86c.png"},{"sourceUrl":"https://storage.googleapis.com/gweb-developer-goog-blog-assets/images/Evaluating_Live_Agent_in_ADK_.2e16d0ba.fill-800x400.png","alt":"How to Evaluate Live & Voice Agents in ADK","afterParagraph":21,"url":"/media/articles/cmtuchdoo175orofpg9odx9p2/66537a33b6cb7f23.png"},{"sourceUrl":"https://storage.googleapis.com/gweb-developer-goog-blog-assets/images/image_9_j6IHMbN.2e16d0ba.fill-800x400.png","alt":"Driving Developer Excellence: Inside the Program Sprints","afterParagraph":22,"url":"/media/articles/cmtuchdoo175orofpg9odx9p2/4ebd29e277d6481d.png"}],"mediaStatus":"ok","articleBodyZh":["当开发人员第一次开始为具代理性的编码系统进行工具开发时，他们经常会陷入同一个陷阱：他们运行像 Terminal-Bench 和 DeepSWE 这样的常见端到端基准，看到综合得分变化了几个百分点，但根本不知道为什么会变化。","端到端基准实际上是评估模型性能和确定哪些方面需要深入调查的标准方法，但问题在于这些调查的成本很高。","行为评估通常是更好的方法，它可以衡量你期望的行为是否真正发生，以及你是在朝正确方向前进还是由于回退或新模型变更而退步。它们可以作为你的迭代伙伴，帮助你洞察为什么某些变化会以某种方式影响结果。","这是我们对行为评估的看法，包括帮助我们在模型演化时保持代理系统可靠的方法。","大多数团队评估 AI 代理的方式就像评估一个参加考试的学生。他们交给代理一个庞大的代码库，给它一个时间限制，并根据有多少测试通过或失败来衡量其成功。","当得分下降时，到底哪里出了问题？","端到端基准通常不能直接回答这些问题。","行为评估的功能类似于提高代理工具操作的集成测试。当你拥有足够丰富的行为评估集时，你就有了针对代理目标行为的基线，并且可以迭代改进提示以达到目标。","行为评估不是衡量代理是否完成了整个多文件重构，而是衡量离散、可观察的动作：","不要在第一天就建立复杂的评估工具，而是利用这段时间跟随你的直觉并进行实验。","在从零开始引导一个代理时，你首先依靠开发者的直觉和自我测试。除非你已经构建了一个能够测试自身代码库、处理样板代码、编写自己的 Markdown 渲染器并执行常规开发任务的代理，否则运行评估没有意义。","评估属于开发的第二阶段：确保前进并防止回退。","评估套件的主要目的是不是为了在你让代理提升2%时庆祝；而是为了让你对新的提示调整、工具模式更改或模型升级没有整体上使代理变得更差有不可动摇的信心。","一个健壮的评估框架将行为断言分解为快速、确定性、类单元的检查，可在本地运行。","将你的注意力转向这些更小、可观察的动作会创建可靠的安全网。你可以自信地迭代你的系统提示或切换到不同的模型，因为你会立即知道是否不小心破坏了核心行为。","行为评估关注中间执行步骤，例如特定的工具调用或文件修改，而不是最终字符串的相等性：","借助丰富的行为评估套件，你可以自动化你的提示工程。例如，你可以设置一个循环，让大型语言模型调整自己的系统提示，迭代直到失败的测试最终通过，同时你的其余测试套件表现得类似于 CI/CD 风格的护栏运作。这有助于确保更改不会破坏任何现有功能。","从一开始，你可以做一些事情来让这个过程可重复。我建议你从一个三步行为测试循环开始：","你的代理不需要更高的基准分数就可以开始。它需要的是一个保持诚实的评估框架。","要构建一个稳定、具有弹性的评估工具，你必须停止将模型当作一个参加期末考试的黑箱来看待，而是开始将你的评估框架当作需要单元测试和集成测试的标准软件来处理。","虽然行为评估是评估框架工程的核心支柱，但它们不能替代更大规模的端到端评估套件。它们实际上是互补的。宏观基准验证最终目标，而微观行为评估作为伙伴，支持安全、快速的迭代。当你采用两者时，你在迭代时（如修改提示、开发新功能或部署全新模型）会有更高的信心水平。","宣布 Kotlin 版 ADK 1.0：在 Kotlin、Android 及更多平台构建生产就绪的 AI 代理","如何在 ADK 中评估实时和语音代理","推动开发者卓越：深入了解项目冲刺"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Google 开发者博客介绍用于 AI 编码智能体的行为评估方法，建议在端到端基准之外，对工具调用、是否先运行验证器等中间执行步骤编写断言，以判断目标行为是否发生，并识别回归。","background":"文章指出，团队通常通过 Terminal-Bench、DeepSWE 等端到端基准和测试通过情况评估智能体，但综合分数变化通常难以直接解释原因。行为评估被描述为改进智能体运行机制的集成测试。","viewpoint":"Aioga 判断：这套方法的核心价值在于把“结果是否正确”进一步拆解为“过程是否符合预期”，从而为提示词迭代和模型变化后的回归检查提供更具体的观察依据。","implications":"可能影响：评估体系可能需要同时覆盖端到端结果与关键行为断言；单一综合分数不足以解释性能变化，也不代表智能体的执行过程可靠。团队应根据预期行为建立可重复的基线。","nextStep":"后续观察：需要关注 Google 是否披露更完整的行为评估案例、断言设计方式及其与现有基准的结合效果，并观察该方法能否稳定识别模型或提示词变化带来的回归。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-09-09T17:43:44.385Z","sourceHash":"150b3daba80a8637","review":{"approved":true,"groundedness":94,"clarity":92,"duplicationRisk":5,"blockingIssues":[],"notes":["“把结果是否正确进一步拆解为过程是否符合预期”属于基于原文的合理概括，已明确标注为 Aioga 判断。","“可能影响”和“后续观察”均使用了适当的推测性表述，未将观点或预测冒充事实。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","editorial-labels","inference-boundary","low-source-overlap","no-html","independent-ai-review"]}},"tags":["行业动态","Google Developers Blog（RSS）"],"translations":{"zh-CN":{"title":"Google 详解 Harness 工程：如何评估、迭代和守护 AI 编码智能体","summary":"Google 开发者博客发文介绍行为评估（behavioral evals）方法，主张不再把智能体当黑盒考试，而是对中间执行步骤（如工具调用、是否先跑验证器）写断言，作为端到端基准如 Terminal-Bench 的补充。","category":"行业动态","source":"developers.googleblog.com","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google 详解 Harness 工程：如何评估、迭代和守护 AI 编码智能体 - Aioga AI资讯","description":"Google 开发者博客发文介绍行为评估（behavioral evals）方法，主张不再把智能体当黑盒考试，而是对中间执行步骤（如工具调用、是否先跑验证器）写断言，作为端到端基准如 Terminal-Bench 的补充。","url":"https://www.aioga.com/news/cmtuchdoo175orofpg9odx9p2/","articleBody":["当开发人员第一次开始为具代理性的编码系统进行工具开发时，他们经常会陷入同一个陷阱：他们运行像 Terminal-Bench 和 DeepSWE 这样的常见端到端基准，看到综合得分变化了几个百分点，但根本不知道为什么会变化。","端到端基准实际上是评估模型性能和确定哪些方面需要深入调查的标准方法，但问题在于这些调查的成本很高。","行为评估通常是更好的方法，它可以衡量你期望的行为是否真正发生，以及你是在朝正确方向前进还是由于回退或新模型变更而退步。它们可以作为你的迭代伙伴，帮助你洞察为什么某些变化会以某种方式影响结果。","这是我们对行为评估的看法，包括帮助我们在模型演化时保持代理系统可靠的方法。","大多数团队评估 AI 代理的方式就像评估一个参加考试的学生。他们交给代理一个庞大的代码库，给它一个时间限制，并根据有多少测试通过或失败来衡量其成功。","当得分下降时，到底哪里出了问题？","端到端基准通常不能直接回答这些问题。","行为评估的功能类似于提高代理工具操作的集成测试。当你拥有足够丰富的行为评估集时，你就有了针对代理目标行为的基线，并且可以迭代改进提示以达到目标。","行为评估不是衡量代理是否完成了整个多文件重构，而是衡量离散、可观察的动作：","不要在第一天就建立复杂的评估工具，而是利用这段时间跟随你的直觉并进行实验。","在从零开始引导一个代理时，你首先依靠开发者的直觉和自我测试。除非你已经构建了一个能够测试自身代码库、处理样板代码、编写自己的 Markdown 渲染器并执行常规开发任务的代理，否则运行评估没有意义。","评估属于开发的第二阶段：确保前进并防止回退。","评估套件的主要目的是不是为了在你让代理提升2%时庆祝；而是为了让你对新的提示调整、工具模式更改或模型升级没有整体上使代理变得更差有不可动摇的信心。","一个健壮的评估框架将行为断言分解为快速、确定性、类单元的检查，可在本地运行。","将你的注意力转向这些更小、可观察的动作会创建可靠的安全网。你可以自信地迭代你的系统提示或切换到不同的模型，因为你会立即知道是否不小心破坏了核心行为。","行为评估关注中间执行步骤，例如特定的工具调用或文件修改，而不是最终字符串的相等性：","借助丰富的行为评估套件，你可以自动化你的提示工程。例如，你可以设置一个循环，让大型语言模型调整自己的系统提示，迭代直到失败的测试最终通过，同时你的其余测试套件表现得类似于 CI/CD 风格的护栏运作。这有助于确保更改不会破坏任何现有功能。","从一开始，你可以做一些事情来让这个过程可重复。我建议你从一个三步行为测试循环开始：","你的代理不需要更高的基准分数就可以开始。它需要的是一个保持诚实的评估框架。","要构建一个稳定、具有弹性的评估工具，你必须停止将模型当作一个参加期末考试的黑箱来看待，而是开始将你的评估框架当作需要单元测试和集成测试的标准软件来处理。","虽然行为评估是评估框架工程的核心支柱，但它们不能替代更大规模的端到端评估套件。它们实际上是互补的。宏观基准验证最终目标，而微观行为评估作为伙伴，支持安全、快速的迭代。当你采用两者时，你在迭代时（如修改提示、开发新功能或部署全新模型）会有更高的信心水平。","宣布 Kotlin 版 ADK 1.0：在 Kotlin、Android 及更多平台构建生产就绪的 AI 代理","如何在 ADK 中评估实时和语音代理","推动开发者卓越：深入了解项目冲刺"]},"en":{"title":"Google Explains Harness Engineering: How to Evaluate, Iterate, and Safeguard AI Coding Agents","summary":"The Google Developer Blog published an article introducing behavioral evals, advocating for no longer treating agents as black boxes for testing, but instead writing assertions for intermediate execution steps (such as tool calls and whether a validator is run first) as a supplement to end-to-end benchmarks like Terminal-Bench.","category":"Industry","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google Explains Harness Engineering: How to Evaluate, Iterate, and Safeguard AI Coding Agents - Aioga AI News","description":"The Google Developer Blog published an article introducing behavioral evals, advocating for no longer treating agents as black boxes for testing, but instead writing assertions for...","url":"https://www.aioga.com/en/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:27:13.986Z"},"ja":{"title":"Google が詳解する Harness エンジニアリング：AI コーディングエージェントを評価、反復、保護する方法","summary":"Google開発者ブログは行動評価（behavioral evals）方法を紹介する記事を掲載し、もはやエージェントをブラックボックスとして試験するのではなく、中間実行ステップ（ツールの呼び出しや検証器を先に実行するかどうかなど）にアサーションを書き、Terminal-Benchのようなエンドツーエンド基準の補完として利用することを提唱している。","category":"業界動向","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google が詳解する Harness エンジニアリング：AI コーディングエージェントを評価、反復、保護する方法 - Aioga AIニュース","description":"Google開発者ブログは行動評価（behavioral evals）方法を紹介する記事を掲載し、もはやエージェントをブラックボックスとして試験するのではなく、中間実行ステップ（ツールの呼び出しや検証器を先に実行するかどうかなど）にアサーションを書き、Terminal-Benchのようなエンドツーエンド基準の補完として利用することを提唱している。","url":"https://www.aioga.com/ja/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:27:22.688Z"},"ko":{"title":"Google 자세히 설명한 Harness 엔지니어링: AI 코딩 에이전트를 평가하고, 반복하며, 지키는 방법","summary":"Google 개발자 블로그가 행동 평가(behavioral evals) 방법을 소개하는 글을 게시했으며, 더 이상 에이전트를 블랙박스 시험으로 보지 않고, 도구 호출이나 먼저 검증기를 실행하는지와 같은 중간 실행 단계에 대해 어설션을 작성하여 Terminal-Bench와 같은 종단 간 기준의 보완으로 삼을 것을 주장하고 있습니다.","category":"업계 동향","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google 자세히 설명한 Harness 엔지니어링: AI 코딩 에이전트를 평가하고, 반복하며, 지키는 방법 - Aioga AI 뉴스","description":"Google 개발자 블로그가 행동 평가(behavioral evals) 방법을 소개하는 글을 게시했으며, 더 이상 에이전트를 블랙박스 시험으로 보지 않고, 도구 호출이나 먼저 검증기를 실행하는지와 같은 중간 실행 단계에 대해 어설션을 작성하여 Terminal-Bench와 같은 종단 간 기준의 보완으로 삼을 것을 주장하고...","url":"https://www.aioga.com/ko/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:28:01.207Z"},"es":{"title":"Google explica en detalle Harness Engineering: cómo evaluar, iterar y proteger agentes inteligentes de codificación AI","summary":"El blog de desarrolladores de Google publicó un artículo sobre el método de evaluación de comportamiento (behavioral evals), que propone dejar de considerar a los agentes como una caja negra en los exámenes, y en su lugar escribir afirmaciones sobre los pasos intermedios de ejecución (como la llamada a herramientas o si primero se ejecuta un verificador), como un complemento a los puntos de referencia de extremo a extremo como Terminal-Bench.","category":"Industria","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google explica en detalle Harness Engineering: cómo evaluar, iterar y proteger agentes inteligentes de codificación AI - Aioga Noticias de IA","description":"El blog de desarrolladores de Google publicó un artículo sobre el método de evaluación de comportamiento (behavioral evals), que propone dejar de considerar a los agentes como una...","url":"https://www.aioga.com/es/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:27:57.137Z"},"fr":{"title":"Google détaille le projet Harness : comment évaluer, itérer et protéger les agents intelligents de codage IA","summary":"Le blog des développeurs de Google a publié un article présentant la méthode d'évaluation comportementale (behavioral evals), préconisant de ne plus considérer les agents comme des boîtes noires à examiner, mais d'écrire des assertions sur les étapes d'exécution intermédiaires (comme l'appel d'outils, ou si un vérificateur est exécuté en premier), en tant que complément aux benchmarks de bout en bout tels que Terminal-Bench.","category":"Industrie","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google détaille le projet Harness : comment évaluer, itérer et protéger les agents intelligents de codage IA - Aioga Actualités IA","description":"Le blog des développeurs de Google a publié un article présentant la méthode d'évaluation comportementale (behavioral evals), préconisant de ne plus considérer les agents comme des...","url":"https://www.aioga.com/fr/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:28:33.899Z"},"de":{"title":"Google erklärt das Harness-Projekt im Detail: Wie man AI-Codierungsagenten bewertet, iteriert und schützt","summary":"Der Google-Entwicklerblog veröffentlichte einen Beitrag zur Vorstellung der Methode der Verhaltensevaluationen (behavioral evals) und befürwortet, Agenten nicht mehr als Blackbox zu prüfen, sondern Assertions über Zwischenschritte der Ausführung (wie Werkzeugeinsatz, ob zuerst ein Validator ausgeführt wird) zu schreiben, als Ergänzung zu End-to-End-Benchmarks wie Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google erklärt das Harness-Projekt im Detail: Wie man AI-Codierungsagenten bewertet, iteriert und schützt - Aioga KI-News","description":"Der Google-Entwicklerblog veröffentlichte einen Beitrag zur Vorstellung der Methode der Verhaltensevaluationen (behavioral evals) und befürwortet, Agenten nicht mehr als Blackbox z...","url":"https://www.aioga.com/de/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:28:37.094Z"},"pt-BR":{"title":"Google detalha o projeto Harness: como avaliar, iterar e proteger agentes inteligentes de codificação de IA","summary":"O blog de desenvolvedores do Google publicou um artigo apresentando o método de avaliação comportamental (behavioral evals), defendendo não mais tratar os agentes como uma caixa-preta para testes, mas escrever asserções sobre etapas intermediárias de execução (como chamadas de ferramentas, se primeiro executar o validador), como complemento a benchmarks de ponta a ponta, como o Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google detalha o projeto Harness: como avaliar, iterar e proteger agentes inteligentes de codificação de IA - Aioga Notícias de IA","description":"O blog de desenvolvedores do Google publicou um artigo apresentando o método de avaliação comportamental (behavioral evals), defendendo não mais tratar os agentes como uma caixa-pr...","url":"https://www.aioga.com/pt-BR/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:29:12.559Z"},"ru":{"title":"Подробное объяснение Google Harness Engineering: как оценивать, итератировать и защищать интеллектуальные агенты кодирования AI","summary":"Блог разработчиков Google опубликовал статью, в которой представлен метод поведенческой оценки (behavioral evals), предлагающий больше не рассматривать агента как черный ящик на экзамене, а писать утверждения для промежуточных шагов выполнения (например, вызов инструментов, сначала ли запускается валидатор) в качестве дополнения к энд-ту-энд эталонам, таким как Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Подробное объяснение Google Harness Engineering: как оценивать, итератировать и защищать интеллектуальные агенты кодирования AI - Aioga Новости ИИ","description":"Блог разработчиков Google опубликовал статью, в которой представлен метод поведенческой оценки (behavioral evals), предлагающий больше не рассматривать агента как черный ящик на эк...","url":"https://www.aioga.com/ru/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:29:15.040Z"},"ar":{"title":"تفسير جوجل لمشروع Harness: كيفية تقييم، تكرار وحماية وكيل الترميز الذكي بالذكاء الاصطناعي","summary":"نشر مدونة مطوري Google مقالًا يقدم طريقة تقييم السلوك (behavioral evals)، ويقترح عدم اعتبار الوكلاء كصندوق أسود للاختبار، بل كتابة تأكيدات للخطوات التنفيذية الوسيطة (مثل استدعاء الأدوات، وما إذا كان يتم تشغيل الموَلِّد أولاً) باعتبارها مكملًا لمعايير شاملة مثل Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"تفسير جوجل لمشروع Harness: كيفية تقييم، تكرار وحماية وكيل الترميز الذكي بالذكاء الاصطناعي - Aioga أخبار الذكاء الاصطناعي","description":"نشر مدونة مطوري Google مقالًا يقدم طريقة تقييم السلوك (behavioral evals)، ويقترح عدم اعتبار الوكلاء كصندوق أسود للاختبار، بل كتابة تأكيدات للخطوات التنفيذية الوسيطة (مثل استدعاء ال...","url":"https://www.aioga.com/ar/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:29:52.528Z"},"hi":{"title":"Google ने Harness इंजीनियरिंग का विस्तृत विवरण दिया: AI कोडिंग एजेंट का मूल्यांकन, पुनरावृत्ति और संरक्षण कैसे करें","summary":"Google डेवलपर ब्लॉग ने व्यवहार मूल्यांकन (behavioral evals) विधि के बारे में पोस्ट की, जिसमें यह प्रस्तावित किया गया कि एजेंट को ब्लैक बॉक्स परीक्षा के रूप में न देखा जाए, बल्कि मध्यवर्ती निष्पादन चरणों (जैसे टूल कॉल, पहले वैरिफ़ायर चलाना है या नहीं) पर असर्शन लिखा जाए, जिसे Terminal-Bench जैसी एंड-टू-एंड बेंचमार्क का पूरक माना जा सके।","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google ने Harness इंजीनियरिंग का विस्तृत विवरण दिया: AI कोडिंग एजेंट का मूल्यांकन, पुनरावृत्ति और संरक्षण कैसे करें - Aioga AI समाचार","description":"Google डेवलपर ब्लॉग ने व्यवहार मूल्यांकन (behavioral evals) विधि के बारे में पोस्ट की, जिसमें यह प्रस्तावित किया गया कि एजेंट को ब्लैक बॉक्स परीक्षा के रूप में न देखा जाए, बल्कि मध...","url":"https://www.aioga.com/hi/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:29:54.649Z"},"it":{"title":"Google spiega in dettaglio il progetto Harness: come valutare, iterare e proteggere gli agenti intelligenti di codifica AI","summary":"Il blog degli sviluppatori di Google ha pubblicato un articolo che introduce i metodi di valutazione comportamentale (behavioral evals), sostenendo di non considerare più gli agenti come scatole nere da esaminare, ma di scrivere asserzioni sui passaggi intermedi dell'esecuzione (come la chiamata agli strumenti, se eseguire prima il validatore), come complemento ai benchmark end-to-end come Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google spiega in dettaglio il progetto Harness: come valutare, iterare e proteggere gli agenti intelligenti di codifica AI - Aioga Notizie IA","description":"Il blog degli sviluppatori di Google ha pubblicato un articolo che introduce i metodi di valutazione comportamentale (behavioral evals), sostenendo di non considerare più gli agent...","url":"https://www.aioga.com/it/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:30:29.743Z"},"nl":{"title":"Google legt Harness-engineering in detail uit: hoe AI-codeagents te evalueren, te itereren en te bewaken","summary":"De Google Developer-blog publiceerde een artikel over de methoden voor gedragsbeoordeling (behavioral evals), waarbij wordt gesteld dat men agenten niet langer als een zwarte doos moet behandelen, maar dat men beweringen moet maken over de tussentijdse uitvoeringsstappen (zoals het gebruik van tools en of eerst een validator wordt uitgevoerd), als aanvulling op end-to-end benchmarks zoals Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google legt Harness-engineering in detail uit: hoe AI-codeagents te evalueren, te itereren en te bewaken - Aioga AI-nieuws","description":"De Google Developer-blog publiceerde een artikel over de methoden voor gedragsbeoordeling (behavioral evals), waarbij wordt gesteld dat men agenten niet langer als een zwarte doos...","url":"https://www.aioga.com/nl/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:30:27.906Z"},"tr":{"title":"Google, Harness Mühendisliğini Detaylı Açıklıyor: AI Kodlama Ajanlarını Nasıl Değerlendireceğiniz, İteratif Geliştireceğiniz ve Koruyacağınız","summary":"Google geliştirici blogu, davranış değerlendirmesi (behavioral evals) yöntemini tanıtan bir yazı yayımladı ve artık ajanı kara kutu muamelesiyle sınamak yerine, araç çağrıları veya önce doğrulayıcıyı çalıştırıp çalıştırmadığı gibi ara yürütme adımlarına ilişkin doğrulamalar yazmayı savunuyor; bu da Terminal-Bench gibi uçtan uca ölçütlere bir tamamlayıcı olarak kullanılıyor.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google, Harness Mühendisliğini Detaylı Açıklıyor: AI Kodlama Ajanlarını Nasıl Değerlendireceğiniz, İteratif Geliştireceğiniz ve Koruyacağınız - Aioga AI Haberleri","description":"Google geliştirici blogu, davranış değerlendirmesi (behavioral evals) yöntemini tanıtan bir yazı yayımladı ve artık ajanı kara kutu muamelesiyle sınamak yerine, araç çağrıları veya...","url":"https://www.aioga.com/tr/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:31:14.261Z"},"vi":{"title":"Google giải thích chi tiết dự án Harness: Cách đánh giá, lặp lại và bảo vệ các tác nhân AI lập trình","summary":"Blog dành cho nhà phát triển của Google đăng bài giới thiệu phương pháp đánh giá hành vi (behavioral evals), đề xuất không còn coi tác nhân là hộp đen để kiểm tra, mà viết các khẳng định cho các bước thực thi trung gian (như gọi công cụ, có chạy trình xác thực trước hay không), như một bổ sung cho các chuẩn đầu-cuối như Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google giải thích chi tiết dự án Harness: Cách đánh giá, lặp lại và bảo vệ các tác nhân AI lập trình - Tin tức AI Aioga","description":"Blog dành cho nhà phát triển của Google đăng bài giới thiệu phương pháp đánh giá hành vi (behavioral evals), đề xuất không còn coi tác nhân là hộp đen để kiểm tra, mà viết các khẳn...","url":"https://www.aioga.com/vi/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:31:05.188Z"},"id":{"title":"Penjelasan Mendalam Google tentang Rekayasa Harness: Bagaimana Menilai, Mengiterasi, dan Melindungi Agen Kecerdasan Buatan dalam Pemrograman","summary":"Blog pengembang Google menerbitkan artikel yang memperkenalkan metode evaluasi perilaku (behavioral evals), menyarankan untuk tidak lagi memperlakukan agen sebagai kotak hitam dalam ujian, melainkan menulis assert pada langkah eksekusi tengah (seperti pemanggilan alat, apakah menjalankan validator terlebih dahulu) sebagai pelengkap untuk tolok ukur end-to-end seperti Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Penjelasan Mendalam Google tentang Rekayasa Harness: Bagaimana Menilai, Mengiterasi, dan Melindungi Agen Kecerdasan Buatan dalam Pemrograman - Berita AI Aioga","description":"Blog pengembang Google menerbitkan artikel yang memperkenalkan metode evaluasi perilaku (behavioral evals), menyarankan untuk tidak lagi memperlakukan agen sebagai kotak hitam dala...","url":"https://www.aioga.com/id/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:31:48.165Z"},"th":{"title":"Google อธิบายรายละเอียดโครงการ Harness: วิธีการประเมิน, ทำซ้ำ และดูแลปัญญาประดิษฐ์สำหรับการเขียนโค้ด","summary":"บล็อกนักพัฒนาของ Google เผยแพร่บทความแนะนำวิธีการประเมินพฤติกรรม (behavioral evals) โดยสนับสนุนให้ไม่มองตัวเอเจนต์เป็นกล่องดำในการสอบอีกต่อไป แต่ให้เขียนการยืนยันเกี่ยวกับขั้นตอนการดำเนินการระหว่างกลาง (เช่น การเรียกใช้งานเครื่องมือ หรือการตรวจสอบว่ารันตัวตรวจสอบก่อนหรือไม่) เพื่อใช้เป็นการเสริมมาตรฐานแบบ end-to-end เช่น Terminal-Bench","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Google อธิบายรายละเอียดโครงการ Harness: วิธีการประเมิน, ทำซ้ำ และดูแลปัญญาประดิษฐ์สำหรับการเขียนโค้ด - ข่าว AI Aioga","description":"บล็อกนักพัฒนาของ Google เผยแพร่บทความแนะนำวิธีการประเมินพฤติกรรม (behavioral evals) โดยสนับสนุนให้ไม่มองตัวเอเจนต์เป็นกล่องดำในการสอบอีกต่อไป แต่ให้เขียนการยืนยันเกี่ยวกับขั้นตอนกา...","url":"https://www.aioga.com/th/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:31:55.594Z"},"pl":{"title":"Szczegółowe omówienie Google Harness Engineering: jak oceniać, iterować i chronić inteligentne agenty kodujące AI","summary":"Blog deweloperski Google opublikował artykuł wprowadzający metodę oceny zachowań (behavioral evals), postulując, aby nie traktować agentów jako czarnych skrzynek do testów, lecz pisać asercje dla pośrednich kroków wykonania (takich jak wywoływanie narzędzi, czy najpierw uruchomić walidator), jako uzupełnienie benchmarków end-to-end, takich jak Terminal-Bench.","category":"行业动态","source":"Google Developers Blog（RSS）","aggregationSource":"Google Developers Blog（RSS）","pageTitle":"Szczegółowe omówienie Google Harness Engineering: jak oceniać, iterować i chronić inteligentne agenty kodujące AI - Aioga Wiadomości AI","description":"Blog deweloperski Google opublikował artykuł wprowadzający metodę oceny zachowań (behavioral evals), postulując, aby nie traktować agentów jako czarnych skrzynek do testów, lecz pi...","url":"https://www.aioga.com/pl/news/cmtuchdoo175orofpg9odx9p2/","contentTranslated":true,"sourceHash":"f8559a39460d5a5b","translatedAt":"2026-09-09T17:32:36.262Z"}},"evidenceTier":"verified-news","reviewStatus":"automated-ingest","indexable":true,"editorialCover":""}}