[論文レビュー] Large Dual Encoders Are Generalizable Retrievers
本稿では、固定された768次元のボトルネック層を備えた大規模なデュアルエンコーダーであるGeneralizable T5ベースのDense Retriever(GTR)を提案する。20億件のコミュニティQAペアを用いた段階的事前学習と、MS MARCOにおけるファインチューニングにより訓練された。固定されたドット積類似度を採用しているが、baseからXXL(最大50億パラメータ)にモデルサイズを拡大することで、BEIRにおけるゼロショットのドメイン外一般化性能が顕著に向上し、GTR-XXLはMS MARCOで最先端の性能と10%のデータ効率を達成した。
It has been shown that dual encoders trained on one domain often fail to generalize to other domains for retrieval tasks. One widespread belief is that the bottleneck layer of a dual encoder, where the final score is simply a dot-product between a query vector and a passage vector, is too limited to make dual encoders an effective retrieval model for out-of-domain generalization. In this paper, we challenge this belief by scaling up the size of the dual encoder model {\em while keeping the bottleneck embedding size fixed.} With multi-stage training, surprisingly, scaling up the model size brings significant improvement on a variety of retrieval tasks, especially for out-of-domain generalization. Experimental results show that our dual encoders, extbf{G}eneralizable extbf{T}5-based dense extbf{R}etrievers (GTR), outperform %ColBERT~\cite{khattab2020colbert} and existing sparse and dense retrievers on the BEIR dataset~\cite{thakur2021beir} significantly. Most surprisingly, our ablation study finds that GTR is very data efficient, as it only needs 10\% of MS Marco supervised data to achieve the best out-of-domain performance. All the GTR models are released at https://tfhub.dev/google/collections/gtr/1.
研究の動機と目的
- デュアルエンコーダーが固定ボトルネック層を持つため、ドメイン外一般化に限界があるという広く受け入れられている考えに挑戦すること。
- ボトルネック次元を固定したままデュアルエンコーダーのモデルサイズを拡大することで、検索性能と一般化性能が向上するかを調査すること。
- コミュニティQAデータを用いた大規模事前学習と、キュレートされたデータセットにおけるファインチューニングが、ゼロショット一般化性能を向上させる有効性を評価すること。
- 特に、人間がアノテートしたトレーニングデータの量が少ない場合、MS MARCOデータの10%程度で最適なドメイン外性能が達成できるかを評価すること。
提案手法
- T5モデルのエンコーダー専用アーキテクチャを採用し、2.5億から50億パラメータのスケーリングを実施したが、ボトルネック次元は常に768に固定した。
- 段階的訓練を実施:まず約20億件のコミュニティQAペアを用いた事前学習を行い、次にMS MARCOでドレインリトリーバー向けにファインチューニングを実施した。
- デュアルエンコーダー構成において、クエリとドキュメントのタワー間でパラメータを共有することで、パラメータ効率と一般化性能を向上させた。
- 追加の相互作用レイヤーを設けずに、クエリとパassage埋め込みの間で単純なドット積類似度を最終スコア関数として使用した。
- MS MARCOを除く9つのドメインにまたがる18のタスクをカバーするBEIRベンチマークで、ゼロショット性能を評価した。
- 事前学習、ファインチューニング、データ効率の影響を分析するためのアブレーションスタディを実施した。
実験結果
リサーチクエスチョン
- RQ1ボトルネック次元を固定したままデュアルエンコーダーのモデルサイズを拡大することで、多様な検索ドメインにおけるゼロショット一般化性能が向上するか?
- RQ2段階的事前学習とファインチューニングを経た大規模なデュアルエンコーダーは、既存のスパースおよびデュアルリトリーバーを上回る性能をドメイン外タスクで示せるか?
- RQ3本手法のデータ効率はいかほどか。特に、MS MARCOデータの10%のみを用いた場合に最適なドメイン外性能が達成できるか?
- RQ4大規模なデュアルエンコーダーの性能は、モデル容量に依存するのか、それともマルチベクトルや相互作用レイヤーのようなアーキテクチャ的革新に依存するのか?
主な発見
- GTR-XXLはBEIRベンチマークで最先端の性能を達成し、18の検索タスクすべてで既存のスパースおよびデュアルリトリーバーを上回った。
- モデルサイズの拡大は一貫してドメイン外一般化性能を向上させ、特にゼロショット評価において最大モデルが最も顕著な向上を示した。
- アブレーションスタディの結果、GTRはMS MARCOトレーニングデータの10%のみで最良のドメイン外性能を達成でき、高いデータ効率を示した。
- 最大のGTR-XXLモデルは、最小のGTR-Baseと比較して、平均して2倍の長さのドキュメントを検索しており、これはWeb-Touche2020のような長文ドキュメント検索タスクでの優れた性能を説明している可能性がある。
- 固定されたドット積類似度であるにもかかわらず、より複雑な相互作用機構を備えたモデルを上回る性能を大規模デュアルエンコーダーが示し、アーキテクチャの必要性に関する仮定に疑問を呈した。
- 推論遅延は17ms(GTR-Base)から349ms(GTR-XXL)に上昇したが、再ランクイングモデルの範囲内に留まり、蒸留やスパarsity技術による最適化の可能性を示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。