Aioga
AI资讯 / 行业动态
返回 AI资讯

Google Antigravity 系列教程 Part 2:用 generate_image 工具自动化图像生成

Google AI:DEV 作者专属(RSS)Aioga 编辑团队2026-09-01T16:51:26.000Z热度 58

这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate...

行业动态Google AI:DEV 作者专属(RSS)

今日 AI 情报摘要

这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate_image

工具,把结构化提示词合成与原生图像生成结合,让 agent 产出符合开发者规范的图像。

中文正文 · AI 翻译

通过将原生图像生成直接与结构化提示合成结合,你可以将你的 AI 代理从文本生成器转变为图像工作室,生成符合开发者规范的干净、一致的图像。

以下是你通过这次深入研究将获得的内容:

📝 关于本系列:欢迎来到《提升反重力代理技能》系列,这是一份五部分的工程指南,旨在掌握那些减少协调负担并将 AI 代理转变为自主协作者的代理工具:ask_question、generate_image、define_subagent + invoke_subagent、send_message 和 manage_subagents。

我们许多开发 Web 应用程序、开发者工具或组件库的人,在等待示例视觉素材时都曾使用过灰色占位框。

generate_image 工具正是在此时派上用场:https://antigravity.google/docs/hooks?utm_campaign=CDR_0xc0d3ff05_awareness_b536569204&utm_medium=external&utm_source=blog#interaction-and-media。当反重力代理执行 generate_image 时,它将文本提示和视觉参数合成成图像,并直接保存到会话工件存储中。

将未经处理、没有结构的提示直接传递给 generate_image 会导致结果不一致。通过将光线、相机和场景规格编码到你的技能提示生成器中,你的代理可以生成始终符合你意图的图像。

在深入技能创作之前,让我们回顾一下反重力如何管理生成的媒体。

当 generate_image 运行时,系统会自动将输出资源保存到会话的内部工件目录(/brain/ /)。该工具返回绝对文件路径,使你的技能能够使用标准 Markdown 语法在聊天响应中直接呈现资源:![说明](file:///path/to/image.png)。

为了实际查看该架构的运作,让我们看看生成模拟图像示例技能:https://github.com/GoogleCloudPlatform/devrel-demos/blob/main/elevating-antigravity/skills/generating-mock-images/SKILL.md。以植物和花卉电商商店为例,该技能生成模拟产品素材,展示生成的图像供交互式审核,并处理工作区资源的持久化。

Mock photos of flowers

:https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgw4uw6nd6itqwdpdhcsr.jpg

图1:当我们提示“创建白色百合的模拟照片”或“...茉莉”,或“...多彩玫瑰”时,生成模拟图像技能会被代理自动发现并解读到上下文中。该技能指示代理按照我们创建的操作手册操作。

该技能将选定的产品主题(用户提供的室内植物或花卉布置)与技能中详细描述的硬编码摄影参数进行匹配:

按照技能指令,代理会自动创建并向generate_image发出结构化工具调用。以下是该结构化工具调用的模拟表示:

注意,本例未显示,但generate_image原生支持视觉合成。将最多三个绝对文件路径传递到ImagePaths数组参数中,指示代理将现有logo、背景纹理或参考线框混合成复合图形。

收到来自generate_image生成的图像路径后,代理立即在聊天中渲染该资产:

在我之前的文章《利用交互式界面工作流程提升反重力代理人技能:https://www.LinkedIn.com/pulse/elevating-antigravity-agent-skills-interactive-ui-james-o-reilly-kz8fc/》中,我阐述了如何利用ask_question工具将被动代理人转化为主动面试官。通过提前询问开发者,我们消除了提示上的歧义。

代理不会假设生成的资产立即准备好生产,而是用ask_question提示开发者:

如果开发者批准了该资源,代理会将文件从临时工件存储复制到 /public/images/,并返回可点击的 markdown 链接:

如果开发者选择删除或重生,代理会清除临时工件,以防止未被策划的资产累积。

如果你的代理直接把未策划的工件导入生产资源路径,你不是在自动化设计,而是在自动化视觉技术债务。

当你将昂贵的工具调用(如 generate_image)集成到自动化开发者工作流中时,请遵守以下三条规则以保持一致性和效率:

避免将原始用户输入直接传递给 generate_image。在你的技能中构建一个提示生成器,注入特定参数(如场景、灯光、摄像机和风格偏好),以确保跨运行的确定性输出。

使用 generate_image 返回的绝对资源路径,并将批准的图像移动到永久存储位置。将资产存储在临时目录(/tmp)中会在上下文窗口清除或工作区会话重启时导致链接失效。

在触发 generate_image 之前,让你的技能检查是否已经存在具有目标 ImageName 的有效资产。未更改参数重新生成图像会浪费计算预算并降低工作流执行速度。

现在你已经掌握了使用 generate_image 的参数化图像生成,这里有一个工程挑战,可以将你的视觉资产技能提升到新水平:

构建一个自动化多纵横比资产套件生成器。

目前,我们的技能要求用户在提示中包含详细信息。

扩展你的技能提示生成器,以使用 ask_question 工具接受目标布局预设(例如,英雄横幅、产品卡片、移动缩略图)或纵横比(例如 1:1、2:1、4:3、16:9)。

扩展你的技能提示生成器,以使用传递给 generate_image 的预制参考图像(通过 ImagePaths 参数传入)。你最多可以包含 3 张图像。

你尝试了这个挑战吗?在下面的评论中分享你的技能策略!

静态文本描述和损坏的图像图标属于早期一代的开发者工具。通过利用 generate_image 中的参数化资产生成,你可以让你的代理生成清晰、一致且视觉上有基准的技术资产。

今天花 15 分钟审查你的组件脚手架和资产生成技能。

pic

模板让你快速回答常见问题或存储片段以便重用。

你确定要隐藏这条评论吗?它将在你的帖子中被隐藏,但仍可通过评论的永久链接查看:#。

对于进一步操作,您可以考虑屏蔽此人和/或举报滥用行为:/report-abuse

Google AI Studio 是开始使用 Gemini 构建的最快方式。准备好开始构建了吗?

DEV 社区:/ — 一个讨论和跟进软件开发以及管理您软件职业生涯的空间

基于 Forem 构建:https://www.forem.com — 开源软件:https://dev.to/t/opensource 驱动 DEV:https://dev.to 及其他包容性社区。

用爱和 Ruby on Rails 制作:https://dev.to/t/rails。DEV 社区 © 2016 - 2026。

我们是一个程序员分享、保持最新动态并发展职业生涯的地方。

Google Antigravity 系列教程 Part 2:用 generate_image 工具自动化图像生成

情报判断

Aioga 编辑摘要

Google 团队发布 Antigravity Agent Skills 系列第二部分教程,主题是使用 generate_image 工具实现图像生成。文章介绍将结构化提示词合成与原生图像生成结合,使 agent 根据开发者规范产出图像。

背景分析

教程属于 Elevating Antigravity Agent Skills 五部曲,系列覆盖 ask_question、generate_image、define_subagent 与 invoke_subagent、send_message、manage_subagents 等工具。文章还说明,生成资产会保存至对话内部 artifacts 目录,并返回绝对文件路径。

Aioga 观点

Aioga 判断:文章重点不只是调用图像生成工具,而是把灯光、相机和场景等视觉参数纳入提示词生成流程。该方法体现了从直接提交未处理提示词,转向按规范组织生成条件的编辑思路。

影响与后续

可能影响:开发者使用 generate_image 时,需要关注提示词结构和视觉参数的一致性;工具返回文件路径可能便于在对话响应中引用资产,但这不代表所有生成结果都能自动满足具体项目规范。 后续观察:应关注后续教程是否进一步说明 generate_image 的配置边界、资产管理方式和在实际开发流程中的使用条件;当前材料不足以判断其生成质量、适用范围或对开发效率的具体影响。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: dev.to

来源: Google AI:DEV 作者专属(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-01T16:51:26.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate...

Google AI:DEV 作者专属(RSS)2026-09-01T16:51:26.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。