Skip to main content
QUICK REVIEW

[論文レビュー] Context Tuning for Retrieval Augmented Generation

Raviteja Anantha, Tharun Bethi|arXiv (Cornell University)|Dec 9, 2023
Topic Modeling被引用数 4
ひとこと要約

この論文は、曖昧または不完全なクエリに対して前もって文脈情報を取得することで、ツール検索と計画生成の精度を向上させる、Retrieval-Augmented Generation (RAG) のための新規コンponent「Context Tuning」を紹介する。数値的、カテゴリー的、使用履歴に基づく信号を活用し、軽量な RRF-LambdaMART モデルを用いることで、文脈検索における Recall@K が 3.5 倍向上し、計画生成の精度が 11.6% 向上する。これは GPT-4 を使用するベースラインよりも優れた性能を示している。

ABSTRACT

Large language models (LLMs) have the remarkable ability to solve new tasks with just a few examples, but they need access to the right tools. Retrieval Augmented Generation (RAG) addresses this problem by retrieving a list of relevant tools for a given task. However, RAG's tool retrieval step requires all the required information to be explicitly present in the query. This is a limitation, as semantic search, the widely adopted tool retrieval method, can fail when the query is incomplete or lacks context. To address this limitation, we propose Context Tuning for RAG, which employs a smart context retrieval system to fetch relevant information that improves both tool retrieval and plan generation. Our lightweight context retrieval model uses numerical, categorical, and habitual usage signals to retrieve and rank context items. Our empirical results demonstrate that context tuning significantly enhances semantic search, achieving a 3.5-fold and 1.5-fold improvement in Recall@K for context retrieval and tool retrieval tasks respectively, and resulting in an 11.6% increase in LLM-based planner accuracy. Additionally, we show that our proposed lightweight model using Reciprocal Rank Fusion (RRF) with LambdaMART outperforms GPT-4 based retrieval. Moreover, we observe context augmentation at plan generation, even after tool retrieval, reduces hallucination.

研究の動機と目的

  • 意味的検索が欠落した文脈によって失敗する、従来の RAG が暗黙的または不完全に指定されたクエリを処理できないという限界に対処すること。
  • 関連する文脈的信号(数値的、カテゴリー的、使用履歴)を取得することで、ツール検索と計画生成の両方の性能を向上させる文脈チューニングコンponent を設計すること。
  • CoT増強や微調整済みモデルを含む、さまざまな文脈検索手法を単体および組み合わせて、実証的に評価・比較すること。
  • 微調整済みの検索モデルにより、CoT 増強の必要性がなくなることを示し、入力長を短縮しながらも性能を維持できることを示すこと。
  • ツールが正しく検索された場合でも、計画生成段階での文脈増強が幻覚を低減することを示すこと。

提案手法

  • ツール検索の前段階として、数値的、カテゴリー的、習慣的使用パターンといった文脈信号を取得・ランク付けする pre-retrieval モジュールとしての Context Tuning を導入する。
  • LambdaMART を用いた学習によるランク付けと、複数の検索信号からの結果を統合するための逆順位融合 (RRF) を組み合わせた軽量な検索モデルを採用する。
  • ハイブリッド検索戦略を採用:意味的類似性と使用パターンに基づいて文脈アイテムを検索し、その後に学習済みの関連スコアを用いて再ランク付けする。
  • ゼロショット CoT 増強と微調整済み検索モデルの両方を適用し、文脈が検索および計画性能に与える影響を評価する。
  • 下限と上限を用いて、文脈の影響を孤立化させ、エンドツーエンドの計画生成精度を、文脈チューニングあり・なしで評価する。
  • 合成されたユーザープロフィールとキャラクターパーソナを用いて、プライバシーを保ちつつ現実世界の RAG シナリオをシミュレートする。
Figure 1: Context-tuned RAG pipeline illustrating end-to-end processing of a complex request with progressive plan generation.
Figure 1: Context-tuned RAG pipeline illustrating end-to-end processing of a complex request with progressive plan generation.

実験結果

リサーチクエスチョン

  • RQ1Context Tuning は、RAG における不完全に指定されたクエリや文脈を求めるクエリに対して、検索性能を著しく向上させることができるか?
  • RQ2検索モデルの微調整により、文脈検索における CoT ベースのクエリ増強の必要性がなくなるか?
  • RQ3計画生成段階での文脈増強は、幻覚と計画生成精度にどのように影響を与えるか?
  • RQ4軽量な検索モデルは、GPT-4 を使用するような大規模言語モデルベースの検索システムを上回ることができるか?
  • RQ5数値的、カテゴリー的、使用履歴に基づくといった、異なる文脈信号のうち、どれが検索効果に最も寄与しているか?

主な発見

  • Context Tuning は、標準的な意味的検索と比較して、文脈検索における Recall@K を 3.5 倍向上させた。
  • Context Tuning を用いることで、ツール検索の Recall@K は 1.5 倍向上し、下流の計画生成における有効性が裏付けられた。
  • 文脈チューニングを施した計画生成器は、AST を用いた計画精度が 85.24% に達し、標準的な RAG ベースの計画生成器と比較して 11.6% の向上を示した。
  • 提案された RRF-LambdaMART モデルは、GPT-4 を使用する検索システムを上回り、最良の設定で NDCG@K が 98.24% を達成した。
  • 検索モデルの微調整により、CoT 増強の必要性が低下し、微調整済みモデルに CoT を追加しても、微調整済みモデル単体と比較して僅かな向上しか得られなかった。
  • ツールが正しく検索された場合でも、計画生成段階での文脈増強により幻覚が 64% 減少(2.59 から 0.93 に)した。
Figure 2: Evaluation of tool retrieval using Recall@k, with and without context tuning.
Figure 2: Evaluation of tool retrieval using Recall@k, with and without context tuning.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。