Skip to main content
QUICK REVIEW

[論文レビュー] Can Old TREC Collections Reliably Evaluate Modern Neural Retrieval Models?

Ellen M. Voorhees, Ian Soboroff|arXiv (Cornell University)|Jan 26, 2022
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

本研究では、TREC-8アドホックテストコレクションが現代のニューラルリtrievalモデルの評価に依然として信頼できるかどうかを検証する。ニューラルモデルは以前に評価されていなかった多くの文書を検索したが、そのほとんどは不適切であった。しかし、元の関連性評価と拡張された関連性評価を使用したランク付けは、ほとんど同一であり、Kendallのτ相関係数は0.99を超えており、コレクションが現代のシステムに対して依然として再利用可能であることを示している。

ABSTRACT

Neural retrieval models are generally regarded as fundamentally different from the retrieval techniques used in the late 1990's when the TREC ad hoc test collections were constructed. They thus provide the opportunity to empirically test the claim that pooling-built test collections can reliably evaluate retrieval systems that did not contribute to the construction of the collection (in other words, that such collections can be reusable). To test the reusability claim, we asked TREC assessors to judge new pools created from new search results for the TREC-8 ad hoc collection. These new search results consisted of five new runs (one each from three transformer-based models and two baseline runs that use BM25) plus the set of TREC-8 submissions that did not previously contribute to pools. The new runs did retrieve previously unseen documents, but the vast majority of those documents were not relevant. The ranking of all runs by mean evaluation score when evaluated using the official TREC-8 relevance judgment set and the newly expanded relevance set are almost identical, with Kendall's tau correlations greater than 0.99. Correlations for individual topics are also high. The TREC-8 ad hoc collection was originally constructed using deep pools over a diverse set of runs, including several effective manual runs. Its judgment budget, and hence construction cost, was relatively large. However, it does appear that the expense was well-spent: even with the advent of neural techniques, the collection has stood the test of time and remains a reliable evaluation instrument as retrieval techniques have advanced.

研究の動機と目的

  • 1999年に構築されたTREC-8アドホックテストコレクションが、現代のニューラルリtrievalモデルの評価に依然として信頼できるかどうかを検証すること。
  • ニューラルモデルが、以前に評価されていなかった関連性の高い文書を大幅に検索するかどうかを評価すること。そのような文書がシステムのランク付けに顕著な影響を与えるかどうかを検討すること。
  • 手動で作成されたプーリングベースのテストコレクションが、その構築に参加していないシステムに対しても再利用可能かどうかを評価すること。
  • 元のTREC-8コレクションにおける高品質な手動ランク付けが、評価の信頼性を維持するために不可欠かどうかを特定すること。

提案手法

  • 新しいプールを構築した。3つのトランスフォーマー基盤モデル(TCT-ColBERT、monoBERT、uniCOIL)と2つのBM25基盤のベースラインに加え、以前に評価されていなかったTREC-8の提出物も含めた。
  • TRECの評価者から、新しいランク付けで検索されたが、以前に評価されていなかった文書について、新たな関連性評価を収集した。
  • 公式のTREC-8関連性評価と拡張された評価セットを使用して、システムのパフォーマンスを評価し、平均スコアとランク付けを比較した。
  • 元のqrelsと拡張されたqrelsを使用したシステムランク付け間のKendallのτ相関を計算し、相対的パフォーマンスの安定性を測定した。
  • 手動ランク付けを含まない形でTREC-8コレクションを再構築し、手動ランク付けの有無が評価信頼性に与える影響をテストした。
  • 手動ランク付けの貢献を除いた場合に失われた関連性のある文書の割合を分析し、それがシステムランク付けに与える影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1現代のニューラルリtrievalモデルは、TREC-8コレクション内で、以前に評価されていなかった関連性のある文書を顕著に検索するか?
  • RQ2ニューラルモデルの出力から得た新しい関連性評価を含めることで、TREC-8上で評価されたリtrievalシステムの相対的ランク付けが顕著に変化するか?
  • RQ3手動ランク付けは、TREC-8テストコレクションの信頼性と再利用可能性にとって、どれほど重要か?
  • RQ4手動ランク付けを含まない自動ランク付けのみで構築されたテストコレクションは、現代のシステムの信頼できる評価に十分な品質を備えているか?

主な発見

  • 新しいニューラルランク付けで検索されたが、以前に評価されていなかった文書の大部分は、関連性がないことが判明した。関連性があると新たに判明した文書はわずかにとどまった。
  • 元の関連性評価と拡張された関連性評価を使用したシステムランク付け間のKendallのτ相関係数は、P@10およびMAPの両方で0.99を超えており、相対的パフォーマンスがほぼ同一であることを示している。
  • 手動ランク付けを元のプール構築から除外しても、相関係数は非常に高く維持された(P@10では0.9964、MAPでは0.9818)。手動評価の欠落に対しても、評価の信頼性が保たれていることを示している。
  • 元々手動ランク付けでのみ検出された1,131件の関連性のある文書のうち、100件が新しいランク付けで回収された。TCT-ColBERTは50件、monoBERTは22件、uniCOILは17件を回収した。
  • BM25+RM3ベースラインは、手動ランク付けでのみ検出された関連性のある文書のうち2件しか回収できず、ニューラルモデルの検索パターンとはほとんど重複がなかった。
  • 10%以上の既知の関連性のある文書が失われたにもかかわらず、システムランク付けは極めて安定しており、TREC-8コレクションが現代のニューラルリtrievalモデルの評価に依然として信頼できるツールであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。