[论文解读] ControlLLM: Augment Language Models with Tools by Searching on Graphs
ControlLLM 引入了一种基于图的推理框架,通过使用 Thoughts-on-Graph (ToG) 模式,在预构建的工具依赖图上搜索最优解法路径,从而增强大型语言模型(LLMs)在多模态工具控制方面的能力。该方法通过将任务规划与 LLM 推理解耦,减少了幻觉现象,并实现了可扩展的工具集成,在涉及视觉、音频和视频的复杂现实任务中提升了准确性和效率,同时在基准指标上表现出更优性能。
We present ControlLLM, a novel framework that enables large language models (LLMs) to utilize multi-modal tools for solving complex real-world tasks. Despite the remarkable performance of LLMs, they still struggle with tool invocation due to ambiguous user prompts, inaccurate tool selection and parameterization, and inefficient tool scheduling. To overcome these challenges, our framework comprises three key components: (1) a extit{task decomposer} that breaks down a complex task into clear subtasks with well-defined inputs and outputs; (2) a extit{Thoughts-on-Graph (ToG) paradigm} that searches the optimal solution path on a pre-built tool graph, which specifies the parameter and dependency relations among different tools; and (3) an extit{execution engine with a rich toolbox} that interprets the solution path and runs the tools efficiently on different computational devices. We evaluate our framework on diverse tasks involving image, audio, and video processing, demonstrating its superior accuracy, efficiency, and versatility compared to existing methods. The code is at https://github.com/OpenGVLab/ControlLLM.
研究动机与目标
- 为解决现有基于 LLM 的工具调用方法存在的局限性,包括幻觉、工具选择不准确以及在复杂多模态任务中调度效率低下等问题。
- 通过将解决方案搜索任务卸载到预构建的工具图上,克服 LLM 在任务规划过程中面临的 token 和推理约束。
- 通过维护一个动态工具图,实现无需微调或提示工程即可可扩展、模块化的新型工具集成。
- 通过在依赖图上进行结构化、拓扑感知的规划,提升工具选择、参数分配和解决方案执行的性能。
- 提供一个全面的基准测试集,包含用于评估多模态 LLM 应用中工具选择、参数一致性及解决方案有效性的指标。
提出的方法
- 一个任务分解器将复杂的用户提示分解为具有明确定义的输入、输出和领域属性的子任务,以支持模块化处理。
- Thoughts-on-Graph (ToG) 模式在预构建的工具图上执行搜索,该图编码了工具之间的依赖关系和关联,从而为每个子任务发现最优路径。
- 工具图基于功能关系和接口规范构建,节点代表工具,边代表数据流和依赖约束。
- 执行引擎解析来自 ToG 的解决方案路径,尽可能并行编排工具调用,并在不同计算设备之间管理输入/输出路由。
- 一个功能丰富的工具箱集成本地和云原生工具,支持多模态输入(图像、音频、视频),并实现高效、反馈驱动的执行。
- 在工具图上应用搜索策略(如广度优先搜索 BFS、深度优先搜索 DFS、A* 算法),以探索可行的解决方案路径,并在最优路径无法满足用户偏好时提供回退机制。
![Figure 1 : Comparisons of different paradigms for task planning. (a) Chain of Thought (CoT) [ 41 ] , CoT with self-consistency [ 40 ] and (b) Tree of Thoughts [ 47 ] (ToT) essentially rely on the LLMs to perform task planning, where the edge is actually formed by LLMs at run time. (c) The Thoughts-o](https://ar5iv.labs.arxiv.org/html/2310.17796/assets/x1.png)
实验结果
研究问题
- RQ1与自回归提示或思维链(CoT)方法相比,基于图的推理框架是否能有效减少工具调用中的幻觉现象?
- RQ2在具有复杂工具依赖关系的复杂多模态任务规划中,ToG 的性能与传统 CoT 和 Tree-of-Thoughts 方法相比如何?
- RQ3当工具箱规模扩大时,该框架在不微调 LLM 的前提下,能否保持高准确率和高效率?
- RQ4该框架在多模态工具执行中,对参数分配一致性及资源幻觉的处理能力如何?
- RQ5该框架在跨多样化模态(图像、音频、视频)和任务类型时,是否仍能保持解决方案质量?
主要发现
- ControlLLM 在多模态基准测试中实现了 92.3% 的解决方案评估(SE)率,显著优于基线方法,在解决复杂现实任务方面表现突出。
- 必要工具包含率(NR)达到 94.1%,表明其在识别任务完成所必需的工具方面具有强大能力。
- 资源幻觉率(HR)降低至 8.7%,证明其有效缓解了 LLM 生成虚假参数的问题。
- 资源类型一致性率(CR)达到 96.4%,证实输入类型与工具需求之间实现了准确对齐。
- 通过将推理从 LLM 迁移到图遍历,该框架显著降低了规划阶段的 token 消耗,实现了可扩展且高效的解决方案搜索。
- 案例研究显示,ToG 能够成功发现涉及图像、视频和音频模态中多个工具的复杂非线性解决方案路径,支持高级多模态交互。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。