[論文レビュー] Generating Synthetic Documents for Cross-Encoder Re-Rankers: A Comparative Study of ChatGPT and Human Experts
本研究では、情報検索におけるクロスエンコーダー再ランク付け器の訓練に、ChatGPTが生成する合成文書と人間が生成する回答の有効性を評価する。ChatGPT-RetrievalQAデータセットを提案し、大規模言語モデル(LLM)が生成するデータで微調整されたモデルが、ゼロショット設定では人間が生成するデータで微調整されたモデルを上回ることを発見した。一方、教師あり設定では人間が生成するデータで微調整されたモデルが依然として優れている。これは、低リソース状況におけるデータ拡張としてLLMの潜在的価値を示している。
We investigate the usefulness of generative Large Language Models (LLMs) in generating training data for cross-encoder re-rankers in a novel direction: generating synthetic documents instead of synthetic queries. We introduce a new dataset, ChatGPT-RetrievalQA, and compare the effectiveness of models fine-tuned on LLM-generated and human-generated data. Data generated with generative LLMs can be used to augment training data, especially in domains with smaller amounts of labeled data. We build ChatGPT-RetrievalQA based on an existing dataset, human ChatGPT Comparison Corpus (HC3), consisting of public question collections with human responses and answers from ChatGPT. We fine-tune a range of cross-encoder re-rankers on either human-generated or ChatGPT-generated data. Our evaluation on MS MARCO DEV, TREC DL'19, and TREC DL'20 demonstrates that cross-encoder re-ranking models trained on ChatGPT responses are statistically significantly more effective zero-shot re-rankers than those trained on human responses. In a supervised setting, the human-trained re-rankers outperform the LLM-trained re-rankers. Our novel findings suggest that generative LLMs have high potential in generating training data for neural retrieval models. Further work is needed to determine the effect of factually wrong information in the generated responses and test our findings' generalizability with open-source LLMs. We release our data, code, and cross-encoders checkpoints for future work.
研究の動機と目的
- 生成的LLM(例:ChatGPT)がクロスエンコーダー再ランク付け器の訓練に適した高品質な合成文書を生成できるかどうかを調査すること。
- 教師ありおよびゼロショット設定の両方で、ChatGPTが生成する回答と人間が生成する回答で微調整されたクロスエンコーダー・モデルの性能を比較すること。
- 特に医療などの専門分野における、LLMが生成するデータの有効性のドメイン依存性を評価すること。
- ラベル付き人間の回答が限られている状況で、LLMが生成する回答を用いて訓練データを拡張する可能性を評価すること。
- 今後のリサーチを支援するため、新しいデータセット「ChatGPT-RetrievalQA」を公開すること。
提案手法
- 著者らは、HC3データセットからクエリと回答を抽出することで、ChatGPT-RetrievalQAデータセットを構築した。このデータセットには、人間とChatGPTが生成した両方の回答が含まれている。
- クロスエンコーダー再ランク付け器は、人間が生成する回答を用いたデータ分割と、ChatGPTが生成する回答を用いたデータ分割の両方で微調整された。
- モデルは、MS MARCO Dev、TREC DL’19、TREC DL’20ベンチマークにおいて、教師ありおよびゼロショット設定の両方で評価された。
- BM25をベースラインとして用い、訓練・検証・テストセット全体で、人間が生成する回答とChatGPTが生成する回答の両方における検索効果を比較した。
- 性能差の潜在的要因を理解するために、クエリと回答の語彙的一致(lexical overlap)を分析した。
- ゼロショットシナリオをシミュレートし、モデルが既知のクエリではあるが、未学習の人の生成した文書に対してテストされた。これにより、モデルの汎化能力が評価された。

実験結果
リサーチクエスチョン
- RQ1教師ありおよびゼロショット設定の両方で、ChatGPTが生成する回答で微調整されたクロスエンコーダー再ランク付け器の有効性は、人間が生成する回答で微調整されたものと比べてどうか?
- RQ2特定分野と一般分野の両方において、ChatGPTを用いて関連する文書を生成する有効性にどのような差があるか?
- RQ3クエリと回答の語彙的一致が、人間が生成する回答とLLMが生成する回答の両方における検索性能にどの程度影響を与えるか?
- RQ4ラベル付き人間の回答が限られている低リソース状況において、LLMが生成する合成文書が訓練データの拡張に効果的に使えるか?
主な発見
- ゼロショット設定では、ChatGPTが生成する回答で微調整されたクロスエンコーダー再ランク付け器が、MS MARCO Dev、TREC DL’19、TREC DL’20の全データセットで、人間が生成する回答で微調整されたモデルを顕著に上回った。
- MS MARCO Devセットでは、ChatGPTの回答で微調整されたMiniLMモデルのNDCG@10スコアは0.388であったのに対し、BM25のスコアは0.202であった。これは、未学習の人の生成した文書に対しても強い汎化能力を示している。
- 教師あり設定では、人間が生成する回答で微調整された再ランク付け器がわずかにLLMが生成する回答で微調整されたモデルを上回った。特に、MiniLM人間モデルはMiniLM ChatGPTモデルよりも高いNDCG@10スコアを達成した。
- ChatGPTが生成する回答のクエリとの語彙的一致は平均34.6%であったのに対し、人間が生成する回答は25.5%であった。これは、検索に役立つ可能性のある高い語彙的一致性を示している。
- すべてのデータ分割において、BM25の検索性能は人間が生成する回答に対しては常にChatGPTが生成する回答よりも低かった。これは、人間の回答はクエリとのマッチングがより困難であることを示している。
- 本研究では、ラベル付き人間データが限られている状況において、LLMが生成するデータが、効果的なゼロショット再ランク付け器の訓練の代替手段として有効であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。