Skip to main content
QUICK REVIEW

[논문 리뷰] ControlLLM: Augment Language Models with Tools by Searching on Graphs

Zhaoyang Liu, Zeqiang Lai|arXiv (Cornell University)|2023. 10. 26.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

ControlLLM는 사전에 구축된 도구 의존성 그래프 위에서 최적의 해결 경로를 탐색하기 위해 Thoughts-on-Graph (ToG) 파рад림을 사용하는 그래프 기반 추론 프레임워크를 도입하여, 시각, 청각, 영상 등 다중 모odal 도구 제어 기능을 강화함으로써 대규모 언어 모델(Large Language Models, LLMs)의 성능을 향상시킨다. 이는 작업 계획을 LLM 추론에서 분리함으로써 환상 현상을 감소시키고, 유연한 도구 통합을 가능하게 하여 복잡한 실생활 작업에서 정확도와 효율성을 향상시킨다. 기준 평가 지표에서 뛰어난 성능을 보인다.

ABSTRACT

We present ControlLLM, a novel framework that enables large language models (LLMs) to utilize multi-modal tools for solving complex real-world tasks. Despite the remarkable performance of LLMs, they still struggle with tool invocation due to ambiguous user prompts, inaccurate tool selection and parameterization, and inefficient tool scheduling. To overcome these challenges, our framework comprises three key components: (1) a extit{task decomposer} that breaks down a complex task into clear subtasks with well-defined inputs and outputs; (2) a extit{Thoughts-on-Graph (ToG) paradigm} that searches the optimal solution path on a pre-built tool graph, which specifies the parameter and dependency relations among different tools; and (3) an extit{execution engine with a rich toolbox} that interprets the solution path and runs the tools efficiently on different computational devices. We evaluate our framework on diverse tasks involving image, audio, and video processing, demonstrating its superior accuracy, efficiency, and versatility compared to existing methods. The code is at https://github.com/OpenGVLab/ControlLLM.

연구 동기 및 목표

  • 기존의 LLM 기반 도구 호출 방법이 겪는 환상, 정확하지 않은 도구 선택, 복잡한 다중 모달 작업에서의 비효율적 스케줄링 등의 한계를 해결하기 위해.
  • 작업 계획 과정에서 LLM의 토큰 및 추론 제약를 해소하기 위해, 해결 경로 탐색을 사전에 구성된 도구 그래프로 이관하기 위해.
  • LLM을 재학습하거나 프롬프트 엔지니어링 없이도 새로운 도구를 확장 가능하고 모듈러하게 통합할 수 있도록 동적 도구 그래프를 유지함으로써 확장성 있는 도구 통합을 가능하게 하기 위해.
  • 의존성 그래프 위에서 구조적이고 토폴로지 인식 기반의 계획을 통해 도구 선택, 인자 할당, 해결 경로 실행을 향상시키기 위해.
  • 다중 모달 LLM 응용 프로그램에서 도구 선택, 인자 일관성, 해결 경로 효과성 평가를 위한 메트릭을 포함하는 종합적인 벤치마크 제공하기 위해.

제안 방법

  • 작업 분해기(Task decomposer)는 복잡한 사용자 프롬프트를 입력, 출력, 도메인 속성을 갖춘 잘 정의된 하위 작업들로 분해하여 모듈러 처리를 가능하게 한다.
  • Thoughts-on-Graph (ToG) 파라다임은 도구 간 의존성과 관계를 인코딩한 사전 구축된 도구 그래프 위에서 검색을 수행하여 각 하위 작업에 대해 최적의 경로를 탐색한다.
  • 도구 그래프는 기능적 관계와 인터페이스 사양에서 유도되며, 노드는 도구를 나타내고, 간선은 데이터 흐름과 의존성 제약 조건을 나타낸다.
  • 실행 엔진은 ToG에서 도출된 해결 경로를 해석하고, 가능한 한 병렬로 도구 호출을 조율하며, 다양한 컴퓨팅 디바이스 간 입력/출력 라우팅을 관리한다.
  • 풍부한 도구 상자(Tobox)는 로컬 및 클라우드 기반 도구를 통합하여 다중 모달 입력(이미지, 음성, 영상)을 지원하고, 피드백 기반의 효율적인 실행을 가능하게 한다.
  • BFS, DFS, A* 등의 검색 전략을 도구 그래프에 적용하여 실현 가능한 해결 경로를 탐색하며, 최적 경로가 사용자 선호도를 충족하지 못할 경우 대체 전략을 적용한다.
Figure 1 : Comparisons of different paradigms for task planning. (a) Chain of Thought (CoT) [ 41 ] , CoT with self-consistency [ 40 ] and (b) Tree of Thoughts [ 47 ] (ToT) essentially rely on the LLMs to perform task planning, where the edge is actually formed by LLMs at run time. (c) The Thoughts-o
Figure 1 : Comparisons of different paradigms for task planning. (a) Chain of Thought (CoT) [ 41 ] , CoT with self-consistency [ 40 ] and (b) Tree of Thoughts [ 47 ] (ToT) essentially rely on the LLMs to perform task planning, where the edge is actually formed by LLMs at run time. (c) The Thoughts-o

실험 결과

연구 질문

  • RQ1그래프 기반 추론 프레임워크는 자동 회귀 프롬프팅 또는 체인 오브 토우크(Chain-of-Thought) 방법 대비 도구 호출 시 환상 현상을 줄일 수 있는가?
  • RQ2ToG는 복잡한 다중 모달 작업에서 복잡한 도구 의존성을 가진 경우 전통적인 CoT 및 Tree-of-Thoughts와 비교해 성능에서 어떤 차이를 보이는가?
  • RQ3LLM을 재학습하지 않고도 대규모 도구 상자에 확장할 경우, 높은 정확도와 효율성을 유지할 수 있는가?
  • RQ4다중 모달 도구 실행에서 인자 할당 일관성과 자원 환상 현상 처리 능력은 얼마나 우수한가?
  • RQ5다양한 모달리티(이미지, 음성, 영상)와 작업 유형에 걸쳐 일반화 능력이 있으며, 해결 품질을 유지할 수 있는가?

주요 결과

  • ControlLLM는 다중 모달 벤치마크에서 92.3%의 해결 평가(SE) 비율을 기록하여 복잡한 실생활 작업을 해결하는 데 있어 기준 방법들을 뛰어넘는 성능을 보였다.
  • 필수 도구 포함 비율(NR)은 94.1%에 도달하여 작업 완료에 필수적인 도구를 식별하는 데 강력한 능력을 보였다.
  • 자원 환상 비율(HR)은 8.7%로 감소하여 LLM이 생성한 잘못된 인자(가짜 인자)를 효과적으로 억제함을 입증했다.
  • 자원 유형 일관성 비율(CR)은 96.4%에 도달하여 입력 유형과 도구 요구 사항 간 정확한 일치를 확인했다.
  • LLM의 추론을 그래프 탐색으로 이관함으로써 계획 단계에서 토큰 소비를 감소시켜 확장 가능하고 효율적인 해결 경로 탐색을 가능하게 했다.
  • 사례 연구 결과, ToG가 이미지, 영상, 음성 모달리티를 포함한 다수의 도구를 연계한 복잡하고 비선형적인 해결 경로를 성공적으로 탐색하여 고도화된 다중 모달 상호작용을 가능하게 했다.
Figure 2 : System design of ControlLLM. The framework consists of three stages. The first stage is task decomposition, which parses the user input into several subtasks. Then, in Stage 2, ToG utilizes a depth-first search algorithm to find the optimal solution for each subtask. The execution engine
Figure 2 : System design of ControlLLM. The framework consists of three stages. The first stage is task decomposition, which parses the user input into several subtasks. Then, in Stage 2, ToG utilizes a depth-first search algorithm to find the optimal solution for each subtask. The execution engine

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.