[論文レビュー] Improving Retrieval-Augmented Large Language Models via Data Importance Learning
この論文は、追加の訓練を必要とせずに、リtrieval-augmented large language models (RAG) のパフォーマンスを向上させるために、多変量拡張を用いたデータ重要度学習フレームワークを提案する。リtrievalコーパスのエントリを再重み付けまたは pruning することで、性能を向上させる。正確な多項式時間アルゴリズムと、効率的な $(\epsilon,\delta)$-近似を導入し、質問応答などのタスクで性能向上を示した。小さなモデル(GPT-JT)でさえ、高重要度データを組み込むことで、GPT-3.5 を上回ることを実証した。
Retrieval augmentation enables large language models to take advantage of external knowledge, for example on tasks like question answering and data imputation. However, the performance of such retrieval-augmented models is limited by the data quality of their underlying retrieval corpus. In this paper, we propose an algorithm based on multilinear extension for evaluating the data importance of retrieved data points. There are exponentially many terms in the multilinear extension, and one key contribution of this paper is a polynomial time algorithm that computes exactly, given a retrieval-augmented model with an additive utility function and a validation set, the data importance of data points in the retrieval corpus using the multilinear extension of the model's utility function. We further proposed an even more efficient (ε, δ)-approximation algorithm. Our experimental results illustrate that we can enhance the performance of large language models by only pruning or reweighting the retrieval corpus, without requiring further training. For some tasks, this even allows a small model (e.g., GPT-JT), augmented with a search engine API, to outperform GPT-3.5 (without retrieval augmentation). Moreover, we show that weights based on multilinear extension can be computed efficiently in practice (e.g., in less than ten minutes for a corpus with 100 million elements).
研究の動機と目的
- 低品質またはノイズの多いリtrievalコーパスが引き起こす、リtrieval-augmented LLM のパフォーマンスボトルネックを解消すること。
- モデルの有用性に与える影響に基づき、リtrievalコーパス内の個々のデータポイントの重要度を定量化する手法を開発すること。
- 追加の訓練を必要とせず、コーパスの再重み付けまたはプルーニングによって RAG モデルのパフォーマンスを向上させること。
- 多項式時間で計算可能な正確なアルゴリズムと、実用的な $(\epsilon,\delta)$-近似を提供すること。
提案手法
- この手法は、モデルの有用性関数の多変量拡張を用い、リtrievalコーパスのすべての部分集合における期待性能を表現する。
- データ重要度を、各データポイントの重みに関する多変量拡張の微分として定式化することで、多項式時間で正確に計算可能となる。
- 大規模コーパス(例:1億エントリ)にスケーリング可能な、効率的な $(\epsilon,\delta)$-近似アルゴリズムを提案。誤差の保証付きで動作する。
- 加法的有用性関数と検証セットを活用し、各データポイントが全体のモデルパフォーマンスに与える寄与度を評価する。
- データ重要度スコアを用いて、リtrievalコーパスを再重み付けまたはプルーニングし、推論時のパフォーマンスを向上させる。
- モデルパラメータを変更せずに、リtriever と generator を備えた RAG モデルにフレームワークを適用する。

実験結果
リサーチクエスチョン
- RQ1多変量拡張を用いたデータ重要度スコアは、微調整なしにリtrieval-augmented LLM の性能を向上させることができるか?
- RQ2大規模リtrievalコーパス(例:1億エントリ)に対して、データ重要度はどの程度効率的に計算可能か?
- RQ3データ重要度に基づくプルーニングまたは再重み付けは、標準的なリtrieval拡張法をどの程度上回るか?
- RQ4高重要度データを組み込んだ場合、小さな LLM(例:GPT-JT)は大きな LLM(例:GPT-3.5)を上回ることができるか?
- RQ5質問応答やデータ補完などの多様な NLP タスクにおいて、この手法はどの程度頑健か?
主な発見
- 提案された正確なアルゴリズムは多項式時間でデータ重要度を計算可能であり、大規模コーパスに対しても実用的である。
- $(\epsilon,\delta)$-近似アルゴリズムは、低い計算コストで高い精度を達成し、実用的な展開が可能である。
- データ重要度に基づくリtrievalコーパスの再重み付けまたはプルーニングにより、微調整なしに全評価タスクでモデルパフォーマンスが向上した。
- WikiFact 質問応答ベンチマークでは、GPT-JT(6B)がデータ重要度に基づくリtrievalを用いることで、GPT-3.5(175B)を複数の関係で上回り、最高で77.5%の精度を達成した。
- この手法は効率的にスケーリング可能であった:1億エントリのコーパスに対するデータ重要度計算は、標準的なマシンで10分未満で完了した。
- 最高パフォーマンスの設定では、ベースラインのリtrieval-augmented モデル比で、精度が相対的に20〜30%向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。