Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Retrieval with Search Agents and Hybrid Environments

Michelle Chen Huebscher, Christian Buck|arXiv (Cornell University)|Sep 30, 2022
Topic Modeling被引用数 5
ひとこと要約

この論文では、密度的(GTR)およびスパース(BM25)検索を組み合わせたハイブリッド検索環境(HRE)とクロスエンコーダー再ランク付けを用い、検索エージェントが反復的にクエリを最適化するゼロショット検索システムHaREを提案する。エージェントはBEIRベンチマークで最先端の性能を達成し、再ランク付け対象のドキュメントを10分の1に削減し、2倍の速度で動作しながらも解釈可能性と強力なドメイン内性能を維持する。

ABSTRACT

Learning to search is the task of building artificial agents that learn to autonomously use a search box to find information. So far, it has been shown that current language models can learn symbolic query reformulation policies, in combination with traditional term-based retrieval, but fall short of outperforming neural retrievers. We extend the previous learning to search setup to a hybrid environment, which accepts discrete query refinement operations, after a first-pass retrieval step via a dual encoder. Experiments on the BEIR task show that search agents, trained via behavioral cloning, outperform the underlying search system based on a combined dual encoder retriever and cross encoder reranker. Furthermore, we find that simple heuristic Hybrid Retrieval Environments (HRE) can improve baseline performance by several nDCG points. The search agent based on HRE (HARE) matches state-of-the-art performance, balanced in both zero-shot and in-domain evaluations, via interpretable actions, and at twice the speed.

研究の動機と目的

  • ハイブリッド環境で密度的およびスパース検索を組み合わせることで、ゼロショット検索性能を向上させること。
  • 離散的なクエリ操作を用いた学習可能な検索エージェントにより、解釈可能で目的志向的な検索行動を可能にすること。
  • 高価なクロスエンコーダー再ランク付けに必要なドキュメント数を最小限に抑えることで、計算コストを削減すること。
  • 最先端のゼロショット結果を達成しつつも、強力なドメイン内性能を維持すること。
  • ハイブリッド検索システムにおいて、効果的で解釈可能な検索方策を学習可能かどうかを検討すること。

提案手法

  • ハイブリッド検索環境(HRE)は、デュアルエンコーダー(GTR)とBM25の結果を統合し、上位-kドキュメントをクロスエンコーダーで再ランクづける。
  • 検索エージェント(HaRE)は、Rocchioベースのセッションプロセスによって生成されたクエリ最適化の軌跡を用いて行動クラーニングにより訓練される。
  • エージェントは主に'+'演算子を用いた語の追加といった、離散的で記号的なクエリ操作を適用し、反復的にクエリを最適化して検索結果を改善する。
  • エージェントは順次的で複数ステップにわたる動作をとる。これは、関連ドキュメントクラスタを探索する人間のような「ラビットホール」的行動を模倣する。
  • トレーニングデータは擬似関連フィードバックを用いて生成され、エージェントは初期クエリの上位結果から学習する。
  • 再ランク付けには大規模なT5ベースのモデル(T5-R)、クエリ生成にはT5-Qを用い、より大きなモデルはより優れたロバストネスを示す。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッド検索環境で動作する学習可能な検索エージェントは、ニューラルリトリーバーを上回るゼロショット検索性能を達成できるか?
  • RQ2離散的で解釈可能なクエリ最適化操作は、計算コストを削減しつつ、どの程度検索性能を向上させられるか?
  • RQ3ハイブリッド検索環境の性能は、より複雑または深層的な再ランク付けベースラインと比べてどうか?
  • RQ4微調整なしで、エージェントはドメイン外クエリに対して効果的に一般化できるか?
  • RQ5モデルスケールは、エージェントおよびそのコンponentsのロバストネスと性能にどのような役割を果たすか?

主な発見

  • HaREはBEIRベンチマークで平均nDCG@10が0.511を達成し、最先端の性能を維持しながら再ランク付け対象を1000件ではなく100件にまで削減した。
  • ハイブリッド検索環境(HRE)は、GTRやBM25単体を使用する場合と比較して、複数のnDCGポイントの性能向上を示した。
  • SOTAシステム(Rosa et al., 2022)が1000件のドキュメントを再ランクづけるのに対し、エージェントは遅延を50%削減した。
  • エージェントはほとんどの場合、'+'演算子のみを用いることが判明し、トレーニングデータに偏りがある可能性(83%のアクションで'+'が使用)を示唆している。
  • HREの設計は単純であるが、より複雑なハイブリッドシステムを上回り、強力なドメイン内性能を維持している。
  • k=50を超えるドキュメントの深さでは性能が低下する傾向にあり、スケールが大きくなると再ランカーのロバストネスに限界があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。