ToolGrad是一种数据生成框架,它颠覆了传统范式,先生成工具调用答案,再生成用户查询。我们的研究表明,这种设计能让大语言模型获得更好的工具调用性能。

快速链接

AI智能体在自动化处理现实世界任务方面已展现出巨大潜力,例如进行谷歌搜索、读取本地计算机文件或执行生成的Python脚本。为实现这类智能体工作流,大语言模型需要学会正确、高效地使用工具。要教会大语言模型使用工具,我们需要包含工具调用链及其对应用户查询的数据集。在我们此前介绍InstructPipe的工作中,我们手动标注了评估数据,但对于先进的大语言模型微调工作流程而言,扩大人工标注规模并不现实。为了简化数据处理流程,此前的工作(例如ToolBench和ToolACE)探索了使用智能体通过试错来自动搜索工具调用路径的方法。这种代表性的标注方法包含两个步骤:(1)从采样的API池中生成一个假设的用户指令,(2)使用深度优先搜索(DFS)智能体来找到其工具调用解决方案。这种方法本质上效率低下,因为其核心理念是从复杂的智能体探索过程中提炼出有价值的轨迹,用于训练大语言模型。

在ACL 2026上发表的论文《ToolGrad:利用文本"梯度"高效生成工具调用数据集》中,我们提出了一种替代性的解决方案范式。ToolGrad首先生成一个真实的工具调用链,然后为其标注对应的用户提示词。直观来看,一个明确的工具调用解决方案比一个提示词提供了更多明确的信息,这使得从工具用法到用户查询的标注变得更加容易,只需一步大语言模型处理即可完成。我们的结果表明,这种以答案为先的方法能够以更低的成本生成更复杂(长链条)的工具调用数据。在我们生成的数据上训练的大语言模型,其表现也优于在基线方法数据上训练的模型,甚至在包含未见过工具的分布外(OOD)数据集上,能够与最先进的专有大语言模型相媲美。

此前的技术通过搜索用户查询的解决方案来生成工具调用数据集,但通过率较低;而ToolGrad在生成提示词之前先生成成功的工具调用链,从而实现了更高的通过率。

利用文本"梯度"进行迭代式工具调用链生成

标准机器学习(ML)系统通过在训练样本的小批量数据上计算数值损失梯度来实现优化,这些梯度随后被优化算法用来更新模型权重。最近,TextGrad将这一范式应用到了提示词工程中,利用大语言模型评判器提供丰富的、描述性的纯文本反馈——这种反馈被称为"文本梯度"。这些文本梯度随后指导给定提示词的优化,将其改进为能更好解决目标任务的新草稿。

ToolGrad将文本梯度的概念从提示词优化领域引入到了合成数据集生成领域。ToolGrad并非优化一个静态的文本提示词,而是利用这些梯度从庞大的工具库中迭代构建复杂、有效的API工作流。

将ToolGrad的优化组件与传统机器学习和TextGrad进行比较。

ToolGrad框架

ToolGrad包含四个核心模块,依次执行提议、执行、选择和更新操作。

重复这一迭代过程,最终生成一个数据样本,其中包含用户查询、经过验证的API工作流以及最终的AI响应。

ToolGrad在生成提示词之前先生成成功的工具调用链,从而实现了较高的通过率。

实验

我们首先评估了数据生成的成本和质量。我们使用包含逾1.6万个真实世界API的ToolBench作为API数据库,来生成我们的工具调用数据集。我们将ToolBench上原有的以查询为先的数据生成方法(使用深度优先搜索DFS)与我们以答案为先的方法(ToolGrad)进行了比较。结果表明,ToolGrad能够以更低的生成成本,生成更复杂且通过率更高的工具调用数据。

以查询为先的方法(基线)与以答案为先的方法(我们的方法)之间的生成效率比较。

我们利用来自ToolBench的API数据库,生成了名为ToolGrad-500的小规模工具调用数据集。随后,我们使用ToolGrad-500对Gemma-3模型(1B、4B和12B)进行了微调,并将这些微调后的模型分别称为ToolGrad-1B、ToolGrad-4B和ToolGrad-12B。我们在伯克利函数调用排行榜(BFCL)上评估了这些模型的工具调用性能,该基准测试的工具集与ToolBench不同。我们将微调后的模型与以下几类模型进行了比较:(1)未经微调的基础模型,(2)最先进的专有模型(Gemini、GPT和Claude),以及(3)最先进的工具调用专用模型(ToolACE、Hammer-2.1-7B)。

以下总结了我们的研究发现。

Gemma-3、ToolGrad系列模型、Gemini 2.5系列、GPT-5、Claude-4.5、ToolACE以及Hammer-2.1-7B模型的BFCL评估结果。

结论与未来方向

ToolGrad证明,通过以答案为先的范式,可以更高效、更可靠地生成高质量的工具调用数据集。通过设计一个利用文本梯度迭代链接API的智能体框架,ToolGrad解决了生成真实数据过程中长期存在的成本和可扩展性瓶颈问题。我们的设计在数据生成中实现了近乎100%的通过率,使相对小巧的模型也能表现出色,并证明了学生大语言模型甚至可以超越其教师模型。

展望未来,通过扩展该框架以处理日益动态和庞大的API生态系统,这项研究可以拓展到更广泛的现实世界应用中。未来的工作还将探索扩展这种自我演进的能力,以支持随时间推移实现持续、即时的个性化学习。随着智能体工作流日益融入企业和日常任务,像ToolGrad这样的框架为训练兼具高能力和经济可扩展部署优势的数字智能体奠定了重要基础。

致谢

这项研究主要由Zhongyi Zhou在谷歌担任访问研究员期间主导完成。我们衷心感谢主要贡献者Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada的支持,并感谢Adarsh Kowdle和Shahram Izadi提供的战略指导和深入审阅。

快速链接

Q&A

Q1:ToolGrad是什么?

A:ToolGrad是一种数据生成框架,它颠覆了传统的先生成用户查询再生成工具调用答案的方式,改为先生成工具调用答案再标注对应的用户查询,从而更高效地生成大语言模型工具调用训练数据。

Q2:ToolGrad相比传统方法有什么优势?

A:ToolGrad能以更低的生成成本,生成更复杂(长链条)的工具调用数据,并且数据生成通过率接近100%。用ToolGrad数据训练的模型表现优于基线方法训练的模型,甚至能在未见过工具的场景下媲美顶尖专有大语言模型。

Q3:ToolGrad训练出来的模型表现如何?

A:研究团队用ToolGrad生成的小规模数据集微调了Gemma-3系列模型(1B、4B、12B),并在伯克利函数调用排行榜(BFCL)上进行评估,结果显示这些相对小巧的模型表现优异,甚至超越了其训练所参考的教师模型。

Google