Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Query Term Independence Assumption for Efficient Retrieval and Ranking using Deep Neural Networks

Bhaskar Mitra, Corby Rosset|arXiv (Cornell University)|Jul 8, 2019
Topic Modeling参考文献 30被引用数 21
ひとこと要約

本稿では、深層ニューラル情報検索モデル(BERT、Duet、CKNRM)に照会語項独立性を組み込むことで、事前計算された語項-文書スコアを可能にし、照会評価コストを著しく削減しながらも高い検索効果を維持することを提案する。驚くべきことに、DuetとCKNRMは顕著な性能低下を示さず、BERTもわずかな低下にとどまる。これにより、モデルを後段の再ランク付けに限定するのではなく、フルコレクション検索が効率的に行えるようになる。

ABSTRACT

Classical information retrieval (IR) methods, such as query likelihood and BM25, score documents independently w.r.t. each query term, and then accumulate the scores. Assuming query term independence allows precomputing term-document scores using these models---which can be combined with specialized data structures, such as inverted index, for efficient retrieval. Deep neural IR models, in contrast, compare the whole query to the document and are, therefore, typically employed only for late stage re-ranking. We incorporate query term independence assumption into three state-of-the-art neural IR models: BERT, Duet, and CKNRM---and evaluate their performance on a passage ranking task. Surprisingly, we observe no significant loss in result quality for Duet and CKNRM---and a small degradation in the case of BERT. However, by operating on each query term independently, these otherwise computationally intensive models become amenable to offline precomputation---dramatically reducing the cost of query evaluations employing state-of-the-art neural ranking models. This strategy makes it practical to use deep models for retrieval from large collections---and not restrict their usage to late stage re-ranking.

研究の動機と目的

  • 照会語項独立性を活用することで、最先端の深層ニューラルIRモデルを用いた効率的かつスケーラブルな検索を可能にすること。
  • 照会語項独立性の下で語項-文書スコアを事前計算しても、ニューラルモデルの検索効果に顕著な影響を与えないかを調査すること。
  • 深層ニューラルモデルを大規模IRシステムにおける最初の段階の検索に実用的なものとする。
  • 強い照会語項独立性の下で、効率性の向上と効果性の低下のトレードオフを評価すること。

提案手法

  • BERT、Duet、CKNRMに照会語項独立性を組み込む。各照会語項を独立して各文書に対してスコア化し、線形的にスコアを統合する。
  • 照会語項独立性の仮定の下で、ニューラルモデルを用いて事前にすべての語項-文書関連スコアを計算する。
  • インverted indexとインパクト順序付けを用いて、事前計算されたスコアに基づき、照会評価時に候補文書を効率的に取得する。
  • 標準的な指標(MRRやrecall@1000)を用いて、MS MARCOパassageランク付けベンチマークでその結果を評価する。
  • 照会語項独立性を適用したバージョンの性能を、元のモデルおよびBM25という強力なベースラインと比較する。
  • 小規模な検索実験を実施し、事前計算されたDuetモデルが最初の段階の検索エンジンとしての有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1BERT、Duet、CKNRMといった深層ニューラルIRモデルに、照会語項独立性を効果的に組み込むことができるか。その際、検索効果に顕著な損失が生じないか。
  • RQ2照会語項独立性の下で語項-文書スコアを事前計算することで、照会評価コストはどの程度削減され、ランク付け品質はどの程度維持されるか。
  • RQ3照問語項独立性を適用したニューラルモデルを、再ランク付けのためではなく、大規模IRシステムにおける最初の段階の検索エンジンとして使用できるか。
  • RQ4照問語項独立性を適用したニューラルモデルの性能は、BM25およびそれらの元のバージョンと比べてどの程度の検索効果を示すか。

主な発見

  • 照問語項独立性を適用したDuetは、MS MARCO開発クエリのサブセットで、recall@1000が0.85、MRR@10が0.218を達成し、BM25(0.80および0.169)を顕著に上回った。
  • 元のDuetモデルと比較して、照問語項独立性を適用したDuetのバージョンには統計的に有意な性能低下が認められなかった。
  • 元のモデルと比較して、照問語項独立性を適用したCKNRMモデルにも顕著な性能低下が認められなかった。
  • 照問語項独立性を適用したBERTモデルはMRRでわずかだが測定可能な低下を示したが、依然として非BERTモデルを上回る性能を示した。
  • 照問語項独立性を適用した事前計算済みDuetモデルは、BM25よりも優れた候補セットを取得できた。これは、最初の段階の検索としての潜在的向上を示唆している。
  • 結果から、少なくともDuetとCKNRMに関しては、事前計算による効率性の向上が、効果性の低下を最小限に抑え、深層モデルによるフルコレクション検索が可能になることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。