Skip to main content
QUICK REVIEW

[論文レビュー] Query expansion with artificially generated texts

Vincent Claveau|arXiv (Cornell University)|Dec 16, 2020
Topic Modeling参考文献 22被引用数 5
ひとこと要約

本稿では、ユーザーのクエリから文脈に適したテキストを生成することで、GPT-2を用いたクエリ拡張を提案する。このアプローチにより、意味的に関連する用語をクエリに統合し、生成されたテキスト内の語の頻度を用いて重み付けを行うことで、検索性能が著しく向上し、MAPで最大10%の向上を達成する。これは、LM+RM3などの強力なベースラインを上回る。

ABSTRACT

A well-known way to improve the performance of document retrieval is to expand the user's query. Several approaches have been proposed in the literature, and some of them are considered as yielding state-of-the-art results in IR. In this paper, we explore the use of text generation to automatically expand the queries. We rely on a well-known neural generative model, GPT-2, that comes with pre-trained models for English but can also be fine-tuned on specific corpora. Through different experiments, we show that text generation is a very effective way to improve the performance of an IR system, with a large margin (+10% MAP gains), and that it outperforms strong baselines also relying on query expansion (LM+RM3). This conceptually simple approach can easily be implemented on any IR system thanks to the availability of GPT code and models.

研究の動機と目的

  • 神経的テキスト生成が、クエリ拡張を通じて文書検索を効果的に向上させられるかどうかを調査すること。
  • 生成されたテキストが、従来の手法と比較してより優れた語の関連性と相対的重み付けを提供するかどうかを評価すること。
  • 本アプローチの実用性と有効性を、特殊分野において評価すること。
  • 生成されたテキストの長さと生成ドキュメント数が検索性能に与える影響を調査すること。
  • LM+RM3や従来のクエリ拡張技術といった強力なベースラインと、本手法を比較すること。

提案手法

  • 目的のドメインに適応するため、ターゲットコーパス上でGPT-2を微調整する。
  • 微調整済みのGPT-2モデルを用い、元のクエリをプロンプトとして複数の完全なテキストドキュメントを生成する。
  • 生成されたテキストから語を抽出し、その頻度をBM25検索モデルにおける重み付けに用いる。
  • 生成されたテキスト内の頻度に基づいて、元のクエリ語の重みを再計算し、検索への寄与度を向上させる。
  • 頻度に基づくまたは固定重みを用いた拡張クエリを、BM25検索システムに適用する。
  • Tipsterなどのベンチマークコレクションを用い、MAP、P@5、P@10、P@20、P@100といった標準的なIR指標で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1GPT-2を用いたクエリからのテキスト生成が、検索性能を向上させる意味的で関連性の高い拡張を生み出せるか?
  • RQ2生成されたテキスト内の語の頻度が、均一またはヒューリスティックベースの重み付け方式よりも優れた語の重み付けを提供するか?
  • RQ31クエリあたりの生成ドキュメント数が検索性能に与える影響は何か?また、ある点で収束(飽和)が生じるか?
  • RQ4本手法は、アドホック検索タスクにおいて、LM+RM3などの確立されたクエリ拡張ベースラインを上回れるか?
  • RQ5限られたラベル付きデータを有する特殊分野において、本アプローチがどの程度一般化可能か?

主な発見

  • 提案されたGPT-2ベースのクエリ拡張手法は、ベースライン手法に対して+10%のMAP向上を達成し、LM+RM3を著しく上回った。
  • 生成されたテキスト内の語の頻度を重み付けに用いることで、MAPに顕著な向上が見られた。固定重み拡張では僅かな向上に留まった。
  • 生成されたテキスト内の頻度に基づいて元のクエリ語の重みを再計算することで、MAPは25.06%(BM25+)から27.12%(BM25+ with re-weighting)に向上した。
  • 1クエリあたり約20ドキュメントを生成した後、性能が頭打ちになったため、この点以降はリターンの減少が見られた。
  • 本手法は特殊分野でも有効であることが示されたため、一般ドメインコレクションにとどまらず、広範な適用可能性を示している。
  • 本手法は新しい語を提供するだけでなく、語の重要性のより正確な推定も可能にし、再現率と正確率の両方を向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。