[論文レビュー] What Are Tools Anyway? A Survey from the Language Model Perspective
本調査では、言語モデルが能力を拡張するために呼び出せる外部プログラムインタフェースとしてのツールを統一的定義し、ツール活用のシナリオと手法を体系的にレビューし、ベンチマークを通じて計算効率とパフォーマンス向上を実証的に評価している。数学的推論においては ToolFormer が最も効率が良く、ツール作成アプローチでは TroVE が最も効率が良いと判明し、ツールを効果的かつ適切に使用する際の実用的ガイダンスを提供している。
Language models (LMs) are powerful yet mostly for text generation tasks. Tools have substantially enhanced their performance for tasks that require complex skills. However, many works adopt the term "tool" in different ways, raising the question: What is a tool anyway? Subsequently, where and how do tools help LMs? In this survey, we provide a unified definition of tools as external programs used by LMs, and perform a systematic review of LM tooling scenarios and approaches. Grounded on this review, we empirically study the efficiency of various tooling methods by measuring their required compute and performance gains on various benchmarks, and highlight some challenges and potential future research in the field.
研究の動機と目的
- 言語モデルが呼び出せる外部プログラムインタフェースとしてのツールを、広範なユースケースにわたって統一的かつ包括的に定義すること。
- 視覚、行動、計算のツールを含む、既存のツール活用シナリオを体系的に分類・レビューすること。
- さまざまなツール活用手法の計算量-パフォーマンスのトレードオフをベンチマークを通じて実証的に評価すること。
- ツール統合によって最も利益を得るタスクと、最も高い効率を示す手法を特定すること。
- 改善された評価指標を提案し、現在のベンチマークにおけるツール利用およびツール作成のギャップを浮き彫りにすること。
提案手法
- 言語モデルが入力引数を伴って呼び出せる外部プログラムへの関数インタフェースとして、LMが使用するツールの形式的定義を提示する。
- ツールを3つの機能的カテゴリーに分類する:視覚(例:get_time())、行動(例:make_post())、計算(例:calculator)。
- イン・コンテキスト学習とリtrieval増強生成に注目した、プロンプティング、ファインチューニング、ツール作成を含むツール活用手法のパラダイムをレビューする。
- 推論およびトレーニングの計算量を用いて、5つのベンチマークで10のツール活用手法を実証的に評価し、パフォーマンス向上とコストを測定する。
- 計算量(トークン/パラメータ)とパフォーマンス(正答率の向上)を比較することで、手法間のコスト効率分析フレームワークを導入する。
- 自然なユースケースと実行可能なツールを備えた、現実性と再現可能性を高めた改善された評価指標およびベンチマークを提案する。

実験結果
リサーチクエスチョン
- RQ1言語モデルの観点から、ツールとは何か。また、多様なユースケースにわたって形式的に定義できるか。
- RQ2どのタスクがツール統合によって最も利益を得るか。また、ツール使用にもかかわらずパフォーマンスが低下するケースがあるのはなぜか。
- RQ3プロンプティング、ファインチューニング、ツール作成などの異なるツール活用手法は、計算効率とパフォーマンス向上の観点でどのように比較できるか。
- RQ4ツール活用手法におけるトレーニング時間コストと推論時間コストの主なトレードオフは何か。
- RQ5現実のツール利用およびツール作成をよりよく反映するために、評価ベンチマークと指標はどのように改善できるか。
主な発見
- MATHベンチマークにおいて、ToolFormerは最高の効率を示し、わずか0.17 MBの計算量で30.4%のパフォーマンス向上を達成した。
- ツール作成アプローチとして、TroVEが最も効率が良く、1.2–1.4Kトークンの計算量で正答率を12.0–21.0ポイント向上させた。
- 多言語翻訳タスクでは、計算コストは同程度であったにもかかわらず、わずかにパフォーマンスが低下(-0.2ポイント)した。これは、本来言語的に自然なタスクではツール活用の恩恵が限定的であることを示唆している。
- API-BankとToolAlpacaは、推論時間の効率性においてToolFormerを上回っており、低遅延デプロイメントに適していると考えられる。
- CREATORとCRAFTはTroVEに比べて著しく非効率であり、わずか0.0–5.0%の正答率向上を得るためだけに、3.8–6.0倍の計算量を要した。
- 複数分野の推論や外部知識を必要とするタスク(例:ツール使用、ツール作成)は、特にAPI-Bank や ToolAlpaca などの合成ベンチマークにおいて、最も高いパフォーマンス向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。