Skip to main content
QUICK REVIEW

[論文レビュー] Overview of the TREC 2019 Fair Ranking Track

Asia J. Biega, Fernando Díaz|arXiv (Cornell University)|Mar 25, 2020
Information Retrieval and Search Behavior参考文献 10被引用数 4
ひとこと要約

本論文は、コンテンツプロバイダーに対する公平性と関連性の両方を評価するベンチマークとしてのTREC 2019 Fair Ranking Trackを紹介する。学術的要約を用いたリランクタスクを提案し、グループ定義(例:機関の評判、hインデックス)が未知の状態での露出メトリクスを用いて公平性を測定する。fair_LambdaMART や uognleMaxUtil といったシステムは、多様なグループ化において高い公平性と有用性のトレードオフを達成したことが報告された。

ABSTRACT

The goal of the TREC Fair Ranking track was to develop a benchmark for evaluating retrieval systems in terms of fairness to different content providers in addition to classic notions of relevance. As part of the benchmark, we defined standardized fairness metrics with evaluation protocols and released a dataset for the fair ranking problem. The 2019 task focused on reranking academic paper abstracts given a query. The objective was to fairly represent relevant authors from several groups that were unknown at the system submission time. Thus, the track emphasized the development of systems which have robust performance across a variety of group definitions. Participants were provided with querylog data (queries, documents, and relevance) from Semantic Scholar. This paper presents an overview of the track, including the task definition, descriptions of the data and the annotation process, as well as a comparison of the performance of submitted systems.

研究の動機と目的

  • 情報検索システムにおける代表されない著者のコンテンツ発見可能性の不均衡を是正すること。
  • 従来の関連性メトリクスに加えて、公平性を評価する標準化されたフレームワークを構築すること。
  • 公平性ランク付け評価のための注釈付き著者グループメンバーシップと関連性ラベルを備えたベンチマークデータセットを作成すること。
  • テスト時に複数の未知のグループ定義に対して頑健なリランキングシステムの開発を促すこと。
  • 個々のランク付けではなく、ランクシーケンス全体における著者の長期的露出を測る公平性メトリクスを促進すること。

提案手法

  • ユーザーの停止確率とランク位置に基づき、著者の期待露出を計算するブラウジングモデルに基づく露出メトリクスを定義する。
  • Semantic Scholarのクリックログを用いて、クリックが関連性を示すと仮定し、二値の関連性ラベルを導出する。
  • 関連性と公平性の両方を最適化するため、各クエリごとに文書セットを再ランク付けするリランクタスクを適用する。
  • 事前に定義された著者グループ間の露出格差から導出される不平等度メトリクスを用いて公平性を測定する。
  • クエリ全体にわたるマクロおよびマイクロアモアタイズド評価を実装し、スケールでのシステムパフォーマンスを評価する。
  • グループ定義が提出後まで非公開となるプロトコルを採用し、異なるグループ化に対してシステムの頑健性をテストする。

実験結果

リサーチクエスチョン

  • RQ1コンテンツプロバイダーの長期的露出を考慮に入れることで、ランク付けにおける公平性をどのように測定できるか?
  • RQ2初期検索結果が支配的著者や機関を優遇するバイアスを、リランキングシステムがどの程度是正できるか?
  • RQ3テスト時に複数の未知のグループ定義がある状況で、異なる公平性指向アルゴリズムのパフォーマンスはいかがなっているか?
  • RQ4さまざまなグループ化スキーム下で、学術的検索ランク付けにおける関連性と公平性のトレードオフはどの程度か?
  • RQ5クリックベースの関連性ラベル付けにおけるバイアスが、ランク付けシステムの公平性評価にどのように影響するか?

主な発見

  • fair_LambdaMART は、2つのグループからなる IMF レベルのグループ定義下で、期待有用性(0.6599)が最も高く、不平等度(0.0741)は中程度であった。
  • uognleMaxUtil は、同じグループ定義下で、期待有用性(0.6741)が最も高く、不平等度(0.0799)は中程度であった。
  • QUARTZ-e0.00100 および QUARTZ-e0.00200 といったシステムは、IMF レベルのグループ化下で不平等度が約 0.035 と高く、公平性パフォーマンスが優れていた。
  • 4つのグループに分けた h インデックスのグループ化下では、fair_LambdaMART は不平等度 0.0855、有用性 0.6599 を達成し、顕著なトレードオフが示された。
  • uognleMaxUtil は、h インデックスのグループ化下で、最高の有用性(0.6741)と中程度の不平等度(0.0656)を達成し、グループ定義にかかわらず強力なパフォーマンスを示した。
  • 結果から、グループ定義が事前に不明な状態でも、公平性に配慮したリランキングにより、関連性を損なわずに露出の平等性を向上させられることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。