[論文レビュー] Large Language Models are Strong Zero-Shot Retriever
この論文では、ドメイン固有の候補回答を用いてクエリを拡張する大規模言語モデル(LLM)を用いるゼロショットリtrieval手法LameRを提案する。微調整されたリtrieverを一切用いず、リtrieval性能を顕著に向上させている。LLMによるクエリ拡張と非パrametricなBM25リtrieverを組み合わせることで、ベンチマークデータセット上で最先端の結果を達成し、ゼロショットおよびフェイシュットベースラインを上回っている。
In this work, we propose a simple method that applies a large language model (LLM) to large-scale retrieval in zero-shot scenarios. Our method, the Language language model as Retriever (LameR), is built upon no other neural models but an LLM, while breaking brute-force combinations of retrievers with LLMs and lifting the performance of zero-shot retrieval to be very competitive on benchmark datasets. Essentially, we propose to augment a query with its potential answers by prompting LLMs with a composition of the query and the query's in-domain candidates. The candidates, regardless of correct or wrong, are obtained by a vanilla retrieval procedure on the target collection. As a part of the prompts, they are likely to help LLM generate more precise answers by pattern imitation or candidate summarization. Even if all the candidates are wrong, the prompts at least make LLM aware of in-collection patterns and genres. Moreover, due to the low performance of a self-supervised retriever, the LLM-based query augmentation becomes less effective as the retriever bottlenecks the whole pipeline. Therefore, we propose to leverage a non-parametric lexicon-based method (e.g., BM25) as the retrieval module to capture query-document overlap in a literal fashion. As such, LameR makes the retrieval procedure transparent to the LLM, thus circumventing the performance bottleneck.
研究の動機と目的
- 自己教師ありリtrieverの性能ボトルネックを解消すること。
- ドメイン固有のアノテート済みクエリ-ドキュメントペアを必要とせずに、強力なゼロショットリtrievalを可能にすること。
- ドメイン固有の候補ドキュメントをコンテキストとして組み込むことで、LLMベースのクエリ拡張を改善すること。
- 非パrametricなリtrieバ(例:BM25)がLLM拡張クエリと組み合わせることで、学習されたリtrieバを上回ることを示すこと。
- モデル固有の埋め込みボトルネックを回避する透明でエンドツーエンドの言語モデル駆動のリtrieバルパイプラインを確立すること。
提案手法
- BM25を用いて取得した上位の候補パラグラフを各クエリに追加し、クエリとその候補回答を含むプロンプトを構築する。
- パターン模倣と要約を活用して、クエリと候補コンテキストに基づき、洗練されたまたは新しい回答をLLMが生成する。
- LLMの出力をクエリ拡張とみなして、2段階目のBM25リtrieバルで元のクエリに置き換える。
- パラメトリックで自己教師ありのリtrieバではなく、非パラメトリックで語彙ベースのリtrieバ(BM25)を用いることで、性能ボトルネックを回避する。
- 拡張クエリとドキュメント間の直接的な語彙的オーバーラップに依存することで、潜在空間の不一致を避ける透明性を確保する。
- エンドツーエンドでこの手法を適用する:BM25リtrieバル → LLMベースのクエリ拡張 → 2段階目のBM25リtrieバル。

実験結果
リサーチクエスチョン
- RQ1ドメイン固有の候補回答をコンテキストとして提供されたLLMは、ゼロショットリtrieバル性能を顕著に向上させることができるか?
- RQ2LLMベースのクエリ拡張と組み合わせた場合、自己教師ありリtrieバを非パラメトリックなBM25リtrieバに置き換えることで、全体のリtrieバルパイプラインの性能が向上するか?
- RQ3LameRは、既存のゼロショットおよびフェイシュットリtrieバル手法と比較して、有効性と効率性の面で優れているか?
- RQ4ドメイン固有の微調整やラベル付きデータなしで、LLM拡張クエリが最先端の性能を達成できるか?
- RQ5LLMベースのクエリ拡張の有効性は、BM25 や密度リtrieバなどの異なるリtrieバルバックボーンにおいても一貫しているか?
主な発見
- LameRはTREC DL19で69.1 nDCG@10、DL20で64.8 nDCG@10を達成し、すべてのゼロショット競合手法を上回り、DL20では最良の完全教師ありリtrieバ(E5 base)をも上回った。
- SimLM密度リtrieバを用いたLameRは、DL19で76.5 nDCG@10、DL20で75.8 nDCG@10を達成し、それぞれベースラインリtrieバに対して+5.1および+6.1の向上を示した。
- LameRはBM25を+18.5 nDCG@10(DL19)および+16.8 nDCG@10(DL20)向上させ、HyDE や Q2D ですらフェイシュットデモを用いても上回った。
- LameRは、BM25 や Contriever や SimLM などの密度リtrieバを含む、さまざまなリtrieバルバックボーンで一貫した性能向上を示し、リtrieバルモデル選択に対して頑健であることがわかった。
- LameRは、密度リtrieバを用いたHyDEと比較して、BM25の効率性のおかげでリtrieバル遅延とインデックスサイズを削減しながら、より高い有効性を達成した。
- この手法は、候補の品質に頑健である:誤った候補でさえも、LLMがドメイン固有のパターンを活用することで、回答の質と関連性が向上する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。