Skip to main content
QUICK REVIEW

[論文レビュー] Query Performance Prediction using Relevance Judgments Generated by Large Language Models

Chuan Meng, Negar Arabzadeh|arXiv (Cornell University)|Apr 1, 2024
Data Quality and ManagementDecision Sciences被引用数 3
ひとこと要約

本稿では、大規模言語モデル(LLM)を用いて文書ごとの独立した関連性判断にQPP(クエリパフォーマンス予測)を分解する新規なQPP-GenREフレームワークを提案する。これにより、複数のIR評価指標の高精度な予測と解釈可能性の向上が可能となる。TREC-DL 19–22で最先端の性能を達成しており、人間がラベル付けした関連性判断で微調整されたLLaMAと、再帰的指標のための効率的な近似戦略を組み合わせたものである。

ABSTRACT

Query performance prediction (QPP) aims to estimate the retrieval quality of a search system for a query without human relevance judgments. Previous QPP methods typically return a single scalar value and do not require the predicted values to approximate a specific information retrieval (IR) evaluation measure, leading to certain drawbacks: (i) a single scalar is insufficient to accurately represent different IR evaluation measures, especially when metrics do not highly correlate, and (ii) a single scalar limits the interpretability of QPP methods because solely using a scalar is insufficient to explain QPP results. To address these issues, we propose a QPP framework using automatically generated relevance judgments (QPP-GenRE), which decomposes QPP into independent subtasks of predicting the relevance of each item in a ranked list to a given query. This allows us to predict any IR evaluation measure using the generated relevance judgments as pseudo-labels. This also allows us to interpret predicted IR evaluation measures, and identify, track and rectify errors in generated relevance judgments to improve QPP quality. We predict an item's relevance by using open-source large language models (LLMs) to ensure scientific reproducibility. We face two main challenges: (i) excessive computational costs of judging an entire corpus for predicting a metric considering recall, and (ii) limited performance in prompting open-source LLMs in a zero-/few-shot manner. To solve the challenges, we devise an approximation strategy to predict an IR measure considering recall and propose to fine-tune open-source LLMs using human-labeled relevance judgments. Experiments on the TREC 2019 to 2022 deep learning tracks and CAsT-19 and 20 datasets show that QPP-GenRE achieves state-of-the-art QPP quality for both lexical and neural rankers.

研究の動機と目的

  • 単一のスカラー予測に依存し、解釈性に欠ける既存のQPP手法の限界を解消すること。
  • 一様なスコアでは多様で相関のないIR評価指標を十分に表現できない「ワンサイズ・フィット・オール」問題を克服すること。
  • 予測結果の解釈を可能にするために、文書ごとの関連性判断を生成することでQPPの解釈性を向上させること。
  • 生成された関連性判断の誤りを特定・是正することで、QPPの品質を向上させること。
  • LLaMAなどのオープンソースLLMを用いることで、科学的再現性を確保すること。

提案手法

  • LLMを用いて、順序付きドキュメントリスト内の各文書の関連性を予測するサブタスクにQPPを分解する。
  • 自動的に生成された関連性判断を偽ラベルとして用い、任意のIR評価指標を予測する。
  • 上位順に限られた数のドキュメントのみを評価することで、再帰的指標(例:RR@10, nDCG@10)を推定する近似戦略を実装する。
  • 人間がラベル付けした関連性判断で、パラメータ効率的微調整(PEFT)を用いてLLaMAを微調整し、生成品質を向上させる。
  • 文書レベルの判断の独立性を活用し、並列化された推論とスケーラビリティを実現する。
  • 推論の精度と計算コストのバランスを取るために、判断深度(n)をハイパーパrameterとして用いる。
Figure 1 . Prompt used by LLMs for automatic generation of relevance judgments.
Figure 1 . Prompt used by LLMs for automatic generation of relevance judgments.

実験結果

リサーチクエスチョン

  • RQ1LLMが生成する関連性判断は、多様なIR評価指標においてQPPの精度と解釈可能性を向上させることができるか?
  • RQ2再帰的指標のための近似戦略は、計算コストを削減しつつQPPの性能にどのように影響を与えるか?
  • RQ3人間がラベル付けした関連性判断でLLaMAを微調整することで、QPPに適した関連性判断の品質はどの程度向上するか?
  • RQ4再トレーニングなしで、QPP-GenREは、語彙的およびニューラルの両方のランカー、および精度指向・再帰指向の両方のIR指標に一般化可能か?
  • RQ51クエリあたりの判断対象ドキュメント数を変化させた場合、QPPの精度と推論遅延のトレードオフはどのようになるか?

主な発見

  • QPP-GenREは、語彙的およびニューラルランカーの両方において、TREC-DL 19–22の精度指向および再帰指向の指標で、最先端の性能を達成した。
  • NQA-QPP、BERTQPP、qppBERT-PL、M-QPPFといった既存のQPPベースラインと比較して、公式IR指標との相関性が顕著に優れている。
  • 判断深度n=10を用いることで、QPP-GenREは1クエリあたり452.60msの推論遅延を達成し、複数の指標を予測する複数の教師ありベースラインよりも低かった。
  • 人間がラベル付けした関連性判断でPEFTを用いてLLaMAを微調整することで、生成された関連性判断の品質が向上し、直接的にQPPの精度が向上した。
  • 再帰的指標のための近似戦略は、全コーパスをスキャンする必要を大幅に削減しながらも、高い予測精度を維持した。
  • QPP-GenREは、QPPの不正確さを観察可能な関連性判断の誤り(例:偽陽性・偽陰性)に翻訳することで、誤差分析を可能にし、モデル改善のための的確な対策を支援した。
(a) BM25 on TREC-DL 19
(a) BM25 on TREC-DL 19

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。