Skip to main content
QUICK REVIEW

[论文解读] IMDB-WIKI-SbS: An Evaluation Dataset for Crowdsourced Pairwise Comparisons

Nikita Pavlichenko, Dmitry Ustalov|arXiv (Cornell University)|Oct 28, 2021
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文介绍了 IMDB-WIKI-SbS,一个大规模开放数据集,包含 9,150 幅图像,经过 250,249 次众包成对比较,用于评估排序模型。该数据集基于 IMDB-WIKI 数据集构建,年龄和性别分布均衡,可实现对成对比较聚合方法的稳健基准测试,取得较高的 NDCG 分数(例如 Bradley-Terry 模型在 @100 时达到 0.859),并支持对人工智能系统中人类偏好建模的系统性评估。

ABSTRACT

Today, comprehensive evaluation of large-scale machine learning models is possible thanks to the open datasets produced using crowdsourcing, such as SQuAD, MS COCO, ImageNet, SuperGLUE, etc. These datasets capture objective responses, assuming the single correct answer, which does not allow to capture the subjective human perception. In turn, pairwise comparison tasks, in which one has to choose between only two options, allow taking peoples' preferences into account for very challenging artificial intelligence tasks, such as information retrieval and recommender system evaluation. Unfortunately, the available datasets are either small or proprietary, slowing down progress in gathering better feedback from human users. In this paper, we present IMDB-WIKI-SbS, a new large-scale dataset for evaluating pairwise comparisons. It contains 9,150 images appearing in 250,249 pairs annotated on a crowdsourcing platform. Our dataset has balanced distributions of age and gender using the well-known IMDB-WIKI dataset as ground truth. We describe how our dataset is built and then compare several baseline methods, indicating its suitability for model evaluation.

研究动机与目标

  • 为解决当前人工智能系统中成对比较模型评估缺乏大规模、开放且分布均衡的数据集的问题。
  • 实现对众包成对比较聚合算法的系统性基准测试,特别是在排序和推荐等主观任务中。
  • 提供一个真实、大规模的评估基准,支持整体性能与子群体性能分析(例如按性别或年龄组划分)。
  • 支持更准确、更鲁棒的模型开发,以将嘈杂的人类偏好聚合为可靠的排序结果。
  • 通过提供公开可用、高质量且具有均衡人口统计分布的数据集,弥合小型开放数据集与大型专有数据集之间的差距。

提出的方法

  • 从 IMDB-WIKI 数据集中提取 9,150 幅图像,通过每个性别-年龄组合采样 75 幅图像,确保在 10–70 岁年龄范围和性别群体中实现均衡分布。
  • 构建一个连通的 Erdős-Rényi 图,包含 250,249 次成对比较,以确保 Bradley-Terry 模型可应用,且通过重排边以实现标签分布的均匀性。
  • 在 Toloka 众包平台上对所有图像对进行标注,使用裁剪的人脸图像,并通过控制任务和工人筛选实现质量控制。
  • 每页采用三任务布局,其中包含一个控制任务,以维持标注质量,每页平均任务时长为 23 秒。
  • 应用四种基线模型:Bradley-Terry(概率成对排序)、PageRank(基于图的中心性)、Random(均匀随机排序)和 Reversed Ground Truth(真实性检查)。
  • 使用 NDCG@k(归一化折损累积增益)评估模型,其中 k=100 用于整体评估,k=10 用于子群体分析。

实验结果

研究问题

  • RQ1在大规模、均衡且开放的人类偏好数据集上,不同成对比较聚合模型的表现如何?
  • RQ2在成对比较任务中,模型性能是否在不同人口子群体(例如男性与女性、不同年龄组)间存在显著差异?
  • RQ3比较图的结构(例如连通与非连通)如何影响 Bradley-Terry 等聚合模型的性能?
  • RQ4像 IMDB-WIKI-SbS 这样大规模开放的数据集能否支持人工智能系统中人类偏好建模的有意义基准测试?
  • RQ5在人类成对判断中,组间比较与组内比较的相对难度如何,其对模型性能有何影响?

主要发现

  • Bradley-Terry 模型在完整 IMDB-WIKI-SbS 数据集上的 NDCG@100 得分为 0.859,显著优于随机基线(0.490)。
  • 性能在不同年龄组间存在差异,Bradley-Terry 模型在 [10;20] 年龄组得分最低(0.358@10),在 [50;60] 年龄组得分最高(0.681@10),表明年轻年龄组的比较更具挑战性。
  • PageRank 在 [60;70] 年龄组的 NDCG@10 达到最高值(0.715),表明其在老年群体中对某些比较模式可能更具鲁棒性。
  • 在 [10;20] 年龄组,随机基线的表现优于 Bradley-Terry 和 PageRank,表明该年龄段的人类判断特别嘈杂或不一致。
  • 反转真实标签基线在所有组别中均接近零的 NDCG 得分,证实评估设置能正确识别错误排序。
  • 在男性与女性子群体之间未观察到显著性能差异,表明模型性能在该数据集中对性别偏差具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。