Skip to main content
QUICK REVIEW

[論文レビュー] IMDB-WIKI-SbS: An Evaluation Dataset for Crowdsourced Pairwise Comparisons

Nikita Pavlichenko, Dmitry Ustalov|arXiv (Cornell University)|Oct 28, 2021
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文は、AIシステムにおける順序付けモデルの評価を目的として、9,150枚の画像と250,249件のクラウドソーシングによるペアワイズ比較を含む大規模オープンデータセットであるIMDB-WIKI-SbSを紹介する。IMDB-WIKIデータセットから作成され、年齢と性別の分布がバランスされているため、ペアワイズ比較集約手法の強固なベンチマークが可能となり、高いNDCGスコア(例:Bradley-Terry法では0.859@100)を達成する。また、AIシステムにおける人間の好みモデリングの体系的評価を支援する。

ABSTRACT

Today, comprehensive evaluation of large-scale machine learning models is possible thanks to the open datasets produced using crowdsourcing, such as SQuAD, MS COCO, ImageNet, SuperGLUE, etc. These datasets capture objective responses, assuming the single correct answer, which does not allow to capture the subjective human perception. In turn, pairwise comparison tasks, in which one has to choose between only two options, allow taking peoples' preferences into account for very challenging artificial intelligence tasks, such as information retrieval and recommender system evaluation. Unfortunately, the available datasets are either small or proprietary, slowing down progress in gathering better feedback from human users. In this paper, we present IMDB-WIKI-SbS, a new large-scale dataset for evaluating pairwise comparisons. It contains 9,150 images appearing in 250,249 pairs annotated on a crowdsourcing platform. Our dataset has balanced distributions of age and gender using the well-known IMDB-WIKI dataset as ground truth. We describe how our dataset is built and then compare several baseline methods, indicating its suitability for model evaluation.

研究の動機と目的

  • AIシステムにおけるペアワイズ比較モデルを評価するための、大規模でオープンかつバランスの取れたデータセットの不足を解消すること。
  • 特に順序付けや推薦などの主観的タスクにおいて、クラウドソーシングによるペアワイズ比較の集約アルゴリズムを体系的にベンチマーク化すること。
  • 全体およびサブグループ(例:性別や年齢層)のパフォーマンス分析を可能にする、現実的で大規模な評価ベンチマークを提供すること。
  • ノイズの多い人間の好みを信頼できる順位付けに集約する、より正確で強固なモデルの開発を支援すること。
  • 小規模なオープンデータセットと大規模な特許データセットの間のギャップを埋めるために、公開可能で高品質で、デモグラフィックの分布がバランスされたデータセットを提供すること。

提案手法

  • 年齢(10–70歳)と性別グループにわたるバランスの取れた表現を確保するため、IMDB-WIKIデータセットから9,150枚の画像を抽出し、各年齢-性別組み合わせから75枚の画像をサンプリングした。
  • Bradley-Terryモデルの適用を保証するため、250,249件のペアワイズ比較を含む連結されたErdős-Rényiグラフを構築し、エッジをシャッフルして均一なラベル分布を確保した。
  • Tolokaのクラウドソーシングプラットフォーム上で、顔をクロップした画像を用いてすべてのペアをアノテートし、制御タスクとワーカーフィルタリングによる品質管理を実施した。
  • 1ページあたり3つのタスク(1つの制御タスクを含む)のレイアウトを採用し、アノテーション品質を維持した。1ページあたりの平均タスク時間は23秒であった。
  • 4つのベースラインモデルを適用した:Bradley-Terry(確率的ペアワイズ順序付け)、PageRank(グラフベースの中心性)、Random(一様ランダム順序付け)、Reversed Ground Truth(健全性チェック)。
  • NDCG@k(正規化された割合付き累積利益)を用いてモデルを評価し、全体評価にはk=100、サブグループ分析にはk=10を用いた。

実験結果

リサーチクエスチョン

  • RQ1異なるペアワイズ比較集約モデルは、人間の好みの大規模でバランスの取れたオープンデータセット上で、どのように性能を発揮するか?
  • RQ2ペアワイズ比較タスクにおいて、モデルのパフォーマンスは性別(例:男性対女性)や年齢層などのデモグラフィックサブグループで顕著に異なるか?
  • RQ3比較グラフの構造(例:連結 vs. 非連結)は、Bradley-Terryのような集約モデルのパフォーマンスにどのように影響するか?
  • RQ4IMDB-WIKI-SbSのような大規模オープンデータセットは、AIシステムにおける人間の好みモデリングの意味のあるベンチマークをサポートできるか?
  • RQ5人間のペアワイズ判断において、グループ間比較とグループ内比較の相対的な難易度は何か? そして、それはモデルのパフォーマンスにどのように影響するか?

主な発見

  • Bradley-Terryモデルは、IMDB-WIKI-SbS全データセットでNDCG@100スコア0.859を達成し、ランダムベースライン(0.490)を顕著に上回った。
  • 年齢層ごとのパフォーマンスに差が認められ、Bradley-Terryモデルは[10;20]歳層で最も低かった(0.358@10)、[50;60]歳層で最も高かった(0.681@10)ことから、若年層の比較がより困難であることが示唆された。
  • [60;70]歳層ではPageRankがNDCG@10で最高のスコア0.715を記録し、高年齢層の特定の比較パターンに対してより頑健である可能性を示唆した。
  • ランダムベースラインは[10;20]歳層でBradley-TerryおよびPageRankを上回ったことから、この年齢層の人間の判断が特にノイズが多く、一貫性が低いことが示された。
  • 逆転された真値ベースラインは、すべてのグループでほぼゼロのNDCGスコアを示し、評価設定が誤った順序付けを正しく同定できていることを確認した。
  • 男性と女性のサブグループ間で顕著なパフォーマンス差は観察されず、このデータセットではモデルのパフォーマンスが性別バイアスに対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。