Skip to main content
QUICK REVIEW

[論文レビュー] Intra-Document Cascading: Learning to Select Passages for Neural Document Ranking

Sebastian Hofstätter, Bhaskar Mitra|arXiv (Cornell University)|May 20, 2021
Topic Modeling参考文献 40被引用数 10
ひとこと要約

本稿では、Intra-Document Cascaded Ranking (IDCM) を提案する。これは、高速で知識蒸留された学生モデル (ESM) を用いて事前に上位k件のパラグラフを選択し、その後に高精度な BERTベースの教師モデル (ETM) をそのパラグラフにのみ適用する二段階のニューラルドキュメント再ランクモデルである。不要なコンテンツを早期に刈り取ることで、IDCM は MS MARCO および TREC Deep Learning Track ベンチマークで最先端の効果性を維持しながら、クエリ待機時間を 400% 以上短縮する。

ABSTRACT

An emerging recipe for achieving state-of-the-art effectiveness in neural document re-ranking involves utilizing large pre-trained language models - e.g., BERT - to evaluate all individual passages in the document and then aggregating the outputs by pooling or additional Transformer layers. A major drawback of this approach is high query latency due to the cost of evaluating every passage in the document with BERT. To make matters worse, this high inference cost and latency varies based on the length of the document, with longer documents requiring more time and computation. To address this challenge, we adopt an intra-document cascading strategy, which prunes passages of a candidate document using a less expensive model, called ESM, before running a scoring model that is more expensive and effective, called ETM. We found it best to train ESM (short for Efficient Student Model) via knowledge distillation from the ETM (short for Effective Teacher Model) e.g., BERT. This pruning allows us to only run the ETM model on a smaller set of passages whose size does not vary by document length. Our experiments on the MS MARCO and TREC Deep Learning Track benchmarks suggest that the proposed Intra-Document Cascaded Ranking Model (IDCM) leads to over 400% lower query latency by providing essentially the same effectiveness as the state-of-the-art BERT-based document ranking models.

研究の動機と目的

  • BERTベースのニューラルドキュメント再ランクの高い推論待機時間の問題に対処すること。これは、パラグラフ単位での BERT スコアリングに起因し、ドキュメント長に比例する。
  • カスケード型の二段階モデルアーキテクチャを導入することで、効率性を向上させながらランク付け効果性を損なわないようにすること。
  • 計算コストを削減することで、強力なニューラル再ランカーを大規模な生産システムに実装可能にする。
  • BERT自身のスコアを教師信号として用いる自己教師学習的手法としての知識蒸留を活用し、効率的なパラグラフ選択モデルを学習することを検討すること。

提案手法

  • モデルは文書内カスケード戦略を採用:軽量で蒸留された学生モデル (ESM) が最初にドキュメント内の上位k件のパラグラフをランク付けして選択する。
  • ESM は、BERTベースの教師モデル (ETM) のパラグラフレベルスコアを用いた知識蒸留により学習され、BERTのランク付け行動を近似できるようにする。
  • その後、選択されたk件のパラグラフのみが、完全な BERT モデル (ETM) でスコアリングされ、ドキュメントあたりの高コストな BERT 推論回数が著しく削減される。
  • ESM は、BERT スコアを単に再現するのではなく、文書内ランク付け損失を追加で最適化することで、選択品質を向上させる。
  • 位置情報信号を保持するために対称的なパディングが使用され、モデルがパラグラフの位置に依存する手がかりを学習できるようにする。
  • 選択モジュールとスコアリングモジュールの協調をバランスさせるために、マルチステージの方法でパイプライン全体が訓練される。

実験結果

リサーチクエスチョン

  • RQ1RQ1: IDCM は、計算コストとクエリ待機時間を削減しながらも、完全な BERT ベースのランカーと同等の効果性を達成できるか?
  • RQ2RQ2: ESM モジュールが選択するパラグラフ数kの変化に伴い、効果性と効率性のトレードオフはどのように変化するか?
  • RQ3RQ3: ESM モジュールは、BERT モデルが選択する上位パラグラフをどれほど正確に再現できるか?
  • RQ4RQ4: 異なるドキュメント関連性グレードおよび位置におけるパラグラフ選択行動に、どのようなパターンが見られるか?

主な発見

  • IDCM は、完全な BERT ベースの再ランカーと比較して、中央値のクエリ待機時間を 400% 以上短縮し、MS MARCO および TREC DL 2019 ベンチマークで同等の効果性を達成した。
  • ESM が BERT パラグラフスコアと文書内ランク付け損失を用いた知識蒸留により学習され、k=40 のパラグラフが BERT スコアリングに選択された場合に最良の性能が得られた。
  • ESM は上位パラグラフの高いリCALLを達成しており、特に高関連性のドキュメントにおいて BERT の選択行動と強く一致していることが示された。
  • モデルは文書の開始部と終了部の両方を活用するよう学習しており、対称的パディングによる位置信号のおかげで、ドキュメント境界付近の関連コンテンツを特定するのに役立っていると考えられる。
  • 1つのパラグラフに対する BERT 推論が中央値待機時間に 25ms 追加する一方で、CK(S) が 40 パラグラフを処理する場合も同程度の実行時間であるため、カスケードによる効率性向上が明確に示された。
  • フレームワークにより、手動アノテーションを自己教師学習による蒸留に置き換えることで、強力なニューラル再ランカーの効率的導入が可能となり、人的労力とコストが削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。