Skip to main content
QUICK REVIEW

[論文レビュー] FIT-RAG: Black-Box RAG with Factual Information and Token Reduction

Yuren Mao, Xuemei Dong|arXiv (Cornell University)|Mar 21, 2024
Handwritten Text Recognition Techniques被引用数 4
ひとこと要約

FIT-RAG は、リtrieval 時に事実情報と LLM の好みを同時に活用することで、LLM の効果性と効率性を向上させるとともに、部分文書レベルのプルーニングと自己知識認識によって入力トークンを削減するブラックボックス型のリtrieval増強生成フレームワークである。PopQA では Llama2-13B-Chat の精度を最大 27.5% 向上させ、全データセットで入力トークンを最大 49% 削減した。

ABSTRACT

Due to the extraordinarily large number of parameters, fine-tuning Large Language Models (LLMs) to update long-tail or out-of-date knowledge is impractical in lots of applications. To avoid fine-tuning, we can alternatively treat a LLM as a black-box (i.e., freeze the parameters of the LLM) and augment it with a Retrieval-Augmented Generation (RAG) system, namely black-box RAG. Recently, black-box RAG has achieved success in knowledge-intensive tasks and has gained much attention. Existing black-box RAG methods typically fine-tune the retriever to cater to LLMs' preferences and concatenate all the retrieved documents as the input, which suffers from two issues: (1) Ignorance of Factual Information. The LLM preferred documents may not contain the factual information for the given question, which can mislead the retriever and hurt the effectiveness of black-box RAG; (2) Waste of Tokens. Simply concatenating all the retrieved documents brings large amounts of unnecessary tokens for LLMs, which degenerates the efficiency of black-box RAG. To address these issues, this paper proposes a novel black-box RAG framework which utilizes the factual information in the retrieval and reduces the number of tokens for augmentation, dubbed FIT-RAG. FIT-RAG utilizes the factual information by constructing a bi-label document scorer. Besides, it reduces the tokens by introducing a self-knowledge recognizer and a sub-document-level token reducer. FIT-RAG achieves both superior effectiveness and efficiency, which is validated by extensive experiments across three open-domain question-answering datasets: TriviaQA, NQ and PopQA. FIT-RAG can improve the answering accuracy of Llama2-13B-Chat by 14.3\% on TriviaQA, 19.9\% on NQ and 27.5\% on PopQA, respectively. Furthermore, it can save approximately half of the tokens on average across the three datasets.

研究の動機と目的

  • 既存のブラックボックス型 RAG システムがリtrieval 時に事実情報を無視し、全ドキュメントを連結することでトークンを無駄に浪費するという課題に対処すること。
  • リtrieval プロセスに事実的関連性と LLM の好みの二重ラベルを組み込むことで、リtrieval の有効性を向上させること。
  • 自己知識認識と部分文書レベルのトークン削減を活用して、入力拡張を削減することで、トークン効率を向上させること。
  • 知識集約的質問応答タスクにおける回答精度と計算効率のバランスの取れたトレードオフを達成すること。
  • 計算リソースが限られ、トークン制約が厳しい実世界のアプリケーションにおけるブラックボックス型 RAG の実用的導入を可能にすること。

提案手法

  • リtrieval 時に、事実的関連性と LLM の好みの両方を最適化する二重ラベルドキュメントスコアラーを提案する。
  • 外部リtrieval が不要な場合に LLM が質問に答えられることを検出する自己知識認識器を導入する。
  • スコア集約とフィルタリングに基づいて、最も関連性の高い部分文書のみを選択する部分文書レベルのトークン削減器を採用する。
  • 推論と説明を促す高度なプロンプトテンプレートを用いることで、取得した知識に対する LLM のパフォーマンスを向上させる。
  • 二重ラベルスコアラーのスコアと組み合わせた上位 k 個のドキュメントを選択するリtrieval 戦略を適用し、最も関連性の高い部分文書にのみトークン削減を適用する。
  • 二段階プロセスを採用する:まず候補ドキュメントをリtrieve し、次に部分文書フィルタリングとトークン削減を実施してから LLM に供給する。

実験結果

リサーチクエスチョン

  • RQ1ブラックボックス型 RAG のリtrieval プロセスに、どのようにして事実情報を効果的に統合することで回答精度を向上させることができるか?
  • RQ2ブラックボックス型 RAG において、リtrieval の有効性を損なわせずに、どの程度のトークン削減が達成可能か?
  • RQ3トークン削減パイプラインにおいて、精度と効率の両立を最適に実現する入力ドキュメントの最適数は何か?
  • RQ4プロンプト設計が、入力トークンを削減したブラックボックス型 RAG のパフォーマンスにどのように影響を与えるか?
  • RQ5自己知識認識器は、ブラックボックス型 RAG において、不要なリtrieval や拡張を効果的に回避できるか?

主な発見

  • FIT-RAG は、TriviaQA で Llama2-13B-Chat の回答精度を 14.3% 向上させ、NQ で 19.9%、PopQA で 27.5% 向上させ、優れた有効性を示した。
  • トークン削減は、TriviaQA で 49%、NQ で 37%、PopQA で 49% の削減を達成し、顕著な効率性の向上を実現した。
  • トークン削減器に 10 個の入力ドキュメントを使用すると、精度とトークン削減の両面で最良のトレードオフが得られ、それ以上に増やすと性能が低下した。
  • 包括的なプロンプトテンプレートは、シンプルなプロンプトと CoT プロンプトに比べて、それぞれ 2.7% と 1.5% の精度向上を達成し、その有効性を示した。
  • 自己知識認識器は、外部リtrieval が不要なケースを効果的に同定し、不要な拡張を削減した。
  • 二重ラベルドキュメントスコアラーは、事実的関連性と LLM の好みを効果的にバランスさせ、誤ったまたは関連性のないドキュメントのリtrieval を防いでいた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。