Aioga
AI资讯 / 行业动态
返回 AI资讯

Google 提出 ToolGrad:用文本"梯度"高效生成工具调用数据集

Google Research:Blog(网页)Aioga 编辑团队2026-09-10T23:28:24.000Z热度 58

Google 提出 ToolGrad,一种先由 LLM 生成工具调用链、再反向标注用户查询的数据生成框架,在 ACL 2026 发表。

行业动态Google Research:Blog(网页)

今日 AI 情报摘要

Google 提出 ToolGrad,一种先由 LLM 生成工具调用链、再反向标注用户查询的数据生成框架,在 ACL 2026 发表。

中文正文 · AI 翻译

周中一,研究科学家;杜若飞,互动感知与图形负责人,谷歌 XR

ToolGrad 是一个数据生成框架,它通过先生成工具使用答案而不是用户查询来颠覆传统范式。我们展示了这种设计能够使大语言模型(LLM)实现更好的工具使用性能。

在 ACL 2026:https://aclanthology.org/2026.findings-acl.950/ 上发表的“ToolGrad: Efficient Tool-use Dataset Generation with Textual ‘Gradients:https://arxiv.org/abs/2508.04086’”中,我们介绍了一种替代的解决方案范式。ToolGrad:https://github.com/zhongyi-zhou/toolgrad 首先生成一个真实的工具使用链,然后再标注其对应的用户提示。直观上,明确的工具使用解决方案提供了比提示更清晰的信息,使得从工具使用到使用查询的标注更容易,仅需一个 LLM 步骤。我们的结果表明,我们的先答方法可以以更低的成本生成更复杂(长周期)的工具使用数据。基于我们生成的数据训练的 LLM 在性能上也超过了基线方法训练的模型,甚至在具有未见工具的分布外(OOD)数据集上可以匹配最先进的专有 LLM。

尽管现有技术通过搜索用户查询的解决方案生成工具使用数据集,但工具通过率低,ToolGrad 则是在生成提示之前生成成功的工具使用链,从而获得高通过率。

标准机器学习(ML)系统通过对训练样本的小批量计算数值损失梯度来改进,然后优化算法使用这些梯度更新模型权重。近期,TextGrad:https://arxiv.org/abs/2406.07496 将这一范式适用于提示工程,利用 LLM 评论者提供丰富的、描述性的纯文本反馈——这种反馈被称为“文本梯度”。这些文本梯度随后指导给定提示的优化,使其生成的新草稿能够更好地完成目标任务。

ToolGrad 将文本梯度的概念从提示优化适配到合成数据集生成。ToolGrad 并非优化静态文本提示,而是使用这些梯度从大型工具库中迭代构建复杂且有效的 API 工作流。

将 ToolGrad 的优化组件与传统机器学习和 TextGrad 进行对比。

ToolGrad 具有四个核心模块,按顺序执行提议、执行、选择和更新。

重复这一迭代过程会生成一个数据样本,包含用户查询、经过验证的 API 工作流以及最终的 AI 响应。

ToolGrad 在生成提示之前生成成功的工具使用链,从而产生高通过率。

我们首先评估数据生成的成本和质量。我们使用 ToolBench:https://arxiv.org/abs/2307.16789 作为我们的 API 数据库,该数据库包含 16k+ 个现实世界的 API,以生成我们的工具使用数据集。我们将 ToolBench 上的原始“先查询”数据生成方法(使用深度优先搜索,DFS)与我们的“先答案”方法 ToolGrad 进行比较。结果表明,ToolGrad 可以以更低的生成成本生成更复杂的工具使用数据且通过率更高。

“先查询”方法(基线)与“先答案”方法(我们的方法)之间的生成效率比较。

我们生成了名为 ToolGrad-500 的小规模工具使用数据集,使用来自 ToolBench 的 API 数据库。然后,我们使用 ToolGrad-500 对 Gemma-3:https://arxiv.org/abs/2503.19786 模型(1B、4B 和 12B)进行微调,并将这些微调模型命名为 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。我们在 Berkeley Function Calling Leaderboard (BFCL):https://gorilla.cs.berkeley.edu/leaderboard.html 上评估了这些模型的工具使用性能,该基准测试的数据工具集与 ToolBench 不同。我们将微调后的模型与 (1) 未微调的基础模型、(2) SoTA 专有模型(Gemini、GPT 和 Claude)、(3) SoTA 工具使用专用模型(ToolACE:https://arxiv.org/abs/2409.00920、Hammer-2.1-7B:https://arxiv.org/abs/2410.04587v2)进行比较。

以下总结了我们的调查结果。

BFCL 在 Gemma-3、ToolGrad 模型、Gemini 2.5 系列、GPT-5、Claude-4.5、ToolACE 和 Hammer-2.1-7B 模型上的评估结果。

ToolGrad 展示了通过“先得答案”范式可以更高效、更可靠地生成高质量的工具使用数据集。通过设计一个能够通过文本梯度迭代地链式调用 API 的智能框架,ToolGrad 解决了长期存在的生成真实数据的成本和可扩展性瓶颈。我们的设计在数据生成中实现了几乎 100% 的通过率,使相对紧凑的模型也能表现出色,并显示出学生 LLM 甚至可以超越其教师。

展望未来,这项研究可以通过扩展框架以处理日益动态和庞大的 API 生态系统,应用到更广泛的现实世界场景。未来的工作还将探索将这种自我进化能力扩展到支持持续的、即时的个性化学习。随着智能工作流程越来越多地嵌入企业和日常任务中,像 ToolGrad 这样的框架为训练既高效又具有经济可扩展性的数字代理奠定了基础。

这项研究主要由周中义在谷歌担任访问研究员期间完成。我们向主要贡献者上原耕平(Kohei Uehara)、张浩宇、周景涛、顾林、许铮、原田达也(Tatsuya Harada)致以诚挚的感谢,并感谢 Adarsh Kowdle 和 Shahram Izadi 在战略指导和细致评审方面的支持。

情报判断

Aioga 编辑摘要

Google Research介绍ToolGrad,这是一个先生成真实工具调用链、再为其标注用户查询的数据生成框架。材料称,该方法发表于ACL 2026,目标是提升工具使用数据的生成效率与质量。

背景分析

ToolGrad借鉴TextGrad的“文本梯度”概念,通过提议、执行、选择和更新四个模块,迭代构建复杂且有效的API工作流,再生成对应用户提示。来源称其可生成更长链路的数据。

Aioga 观点

Aioga 判断:ToolGrad的核心变化在于调整数据构造顺序,从先理解查询转向先形成工具使用方案,再反向生成查询。该思路为合成工具调用数据提供了不同于传统方法的路径。

影响与后续

可能影响:如果来源所述结果能够在更多工具和任务上复现,工具调用数据的构建流程可能更重视可执行链路与标注效率。但现有材料不足以证明其适用范围或长期优势。 后续观察:应关注论文与代码中关于实验设置、成本比较、长链路定义及未见工具数据集表现的具体证据,并核对其与基线方法和专有模型比较的条件。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: research.google

来源: Google Research:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-10T23:28:24.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 提出 ToolGrad,一种先由 LLM 生成工具调用链、再反向标注用户查询的数据生成框架,在 ACL 2026 发表。

Google Research:Blog(网页)2026-09-10T23:28:24.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。