Skip to main content
QUICK REVIEW

[논문 리뷰] What Are Tools Anyway? A Survey from the Language Model Perspective

Zhiruo Wang, Zhoujun Cheng|arXiv (Cornell University)|2024. 03. 18.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 종합 검토에서는 언어 모델이 기능을 확장하기 위해 호출할 수 있는 외부 프로그램 인터페이스로 도구를 통합된 정의로 제시하고, 도구 사용 시나리오와 방법을 체계적으로 검토하며, 벤치마크를 통해 계산 효율성과 성능 향상을 실증적으로 평가한다. 도구 사용에서 수학적 추론에 가장 효율적인 방법으로 ToolFormer를, 도구 제작에 가장 효율적인 접근으로 TroVE를 확인하였으며, 도구를 효과적으로 사용할 때와 어떻게 사용할지를 위한 실용적 지침을 제공한다.

ABSTRACT

Language models (LMs) are powerful yet mostly for text generation tasks. Tools have substantially enhanced their performance for tasks that require complex skills. However, many works adopt the term "tool" in different ways, raising the question: What is a tool anyway? Subsequently, where and how do tools help LMs? In this survey, we provide a unified definition of tools as external programs used by LMs, and perform a systematic review of LM tooling scenarios and approaches. Grounded on this review, we empirically study the efficiency of various tooling methods by measuring their required compute and performance gains on various benchmarks, and highlight some challenges and potential future research in the field.

연구 동기 및 목표

  • 언어 모델이 호출할 수 있는 외부 프로그램 인터페이스로 도구를 포괄적이고 통합된 정의를 수립하기 위해.
  • 시각, 행동, 계산 도구를 포함한 기존 도구 사용 시나리오를 체계적으로 분류하고 검토하기 위해.
  • 다양한 도구 사용 방법의 계산-성능 트레이드오프를 다양한 벤치마크에서 실증적으로 평가하기 위해.
  • 도구 통합으로 가장 큰 이점을 얻는 작업과 가장 높은 효율성을 제공하는 방법을 특정하기 위해.
  • 개선된 평가 지표를 제안하고 현재 도구 사용 및 도구 제작에 대한 벤치마크의 격차를 부각하기 위해.

제안 방법

  • 언어 모델이 입력 인자를 통해 호출할 수 있는 외부 프로그램에 대한 함수 인터페이스로 LM가 사용하는 도구를 공식 정의한다.
  • 도구를 세 가지 기능적 범주로 분류한다: 시각(예: get_time()), 행동(예: make_post()), 계산(예: calculator).
  • 프롬프팅, 피니테이닝, 도구 제작을 포함한 도구 사용 패러다임을 검토하며, 특히 인라인 학습과 검색 증강 생성에 중점을 둔다.
  • 10개의 도구 사용 방법을 5개의 벤치마크에서 인퍼런스 및 훈련 계산을 사용해 실증 평가하며, 성능 향상과 비용을 측정한다.
  • 계산(토큰/파rameter 수)과 성능(정확도 향상)을 기준으로 방법 간의 비용-효율성 분석 프레임워크를 도입한다.
  • 향상된 평가 지표와 자연스러운 사용 사례 및 실행 가능한 도구를 포함한 벤치마크를 제안하여 현실성과 재현 가능성을 향상시킨다.
Figure 1: Illustration of tools extending and facilitating LM task-solving.
Figure 1: Illustration of tools extending and facilitating LM task-solving.

실험 결과

연구 질문

  • RQ1언어 모델의 관점에서 도구는 무엇을 의미하며, 다양한 사용 사례에서 공식적으로 어떻게 정의할 수 있는가?
  • RQ2어떤 작업이 도구 통합으로 가장 큰 이점을 얻는가? 그리고 일부 작업은 도구 사용에도 불구하고 성능 저하가 발생하는 이유는 무엇인가?
  • RQ3프롬프팅, 피니테이닝, 도구 제작과 같은 다양한 도구 사용 방법 간의 계산 효율성과 성능 향상 측면에서의 비교는 어떻게 이루어지는가?
  • RQ4도구 사용 접근법에서 훈련 시간 비용과 인퍼런스 시간 비용 간의 주요 트레이드오프는 무엇인가?
  • RQ5실제 도구 사용과 도구 제작을 더 잘 반영하기 위해 평가 벤치마크와 지표는 어떻게 개선될 수 있는가?

주요 결과

  • ToolFormer는 MATH 벤치마크에서 가장 높은 효율성을 보이며, 단지 0.17 MB의 계산 자원으로 30.4%의 성능 향상을 달성한다.
  • TroVE는 가장 효율적인 도구 제작 방법으로, 단지 1.2–1.4K 토큰의 계산 자원으로 정확도를 12.0–21.0점 향상시킨다.
  • 다국어 번역 작업은 유사한 계산 비용에도 불구하고 성능이 약간 저하되며(-0.2점) 발생하여, 본질적으로 언어적으로 익숙한 작업에는 도구 사용의 이점이 제한됨을 시사한다.
  • API-Bank과 ToolAlpaca는 인퍼런스 시간 효율성에서 ToolFormer를 능가하여, 저지연 배포에 더 적합함을 시사한다.
  • CREATOR와 CRAFT는 TroVE에 비해 상당히 효율성이 떨어지며, 정확도 향상이 근소하게(0.0–5.0%) 이루어지는 데에도 불구하고 3.8–6.0배 더 많은 계산 자원이 필요하다.
  • 다양한 도메인의 추론이나 외부 지식이 필요한 작업(예: 도구 사용, 도구 제작)은 특히 API-Bank과 ToolAlpaca와 같은 합성 벤치마크에서 가장 높은 성능 향상을 보이며, 이는 도구 통합의 잠재력을 잘 보여준다.
Figure 2: The basic tool use paradigm. LM calls check_weather tool by generating text tokens. This call triggers the server to execute the call and return the output sunny , using which the LM replaces the API call tokens in the response to the user.
Figure 2: The basic tool use paradigm. LM calls check_weather tool by generating text tokens. This call triggers the server to execute the call and return the output sunny , using which the LM replaces the API call tokens in the response to the user.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.