Skip to main content
QUICK REVIEW

[논문 리뷰] IMDB-WIKI-SbS: An Evaluation Dataset for Crowdsourced Pairwise Comparisons

Nikita Pavlichenko, Dmitry Ustalov|arXiv (Cornell University)|2021. 10. 28.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 인공지능 시스템의 순위 모델 평가를 위해 9,150장의 이미지와 250,249개의 공동으로 수집된 쌍대 비교 결과를 포함하는 대규모 오픈 데이터셋인 IMDB-WIKI-SbS를 소개한다. IMDB-WIKI 데이터셋에서 유래되었으며 나이와 성별 분포가 균형 잡혀 있어 쌍대 비교 집계 방법의 강력한 벤치마킹을 가능하게 하며, 브래드리-테리 모델의 경우 NDCG 점수(예: 100@0.859)가 매우 높게 기록되었고, 인공지능 시스템 내 인간 선호 모델링의 체계적 평가를 지원한다.

ABSTRACT

Today, comprehensive evaluation of large-scale machine learning models is possible thanks to the open datasets produced using crowdsourcing, such as SQuAD, MS COCO, ImageNet, SuperGLUE, etc. These datasets capture objective responses, assuming the single correct answer, which does not allow to capture the subjective human perception. In turn, pairwise comparison tasks, in which one has to choose between only two options, allow taking peoples' preferences into account for very challenging artificial intelligence tasks, such as information retrieval and recommender system evaluation. Unfortunately, the available datasets are either small or proprietary, slowing down progress in gathering better feedback from human users. In this paper, we present IMDB-WIKI-SbS, a new large-scale dataset for evaluating pairwise comparisons. It contains 9,150 images appearing in 250,249 pairs annotated on a crowdsourcing platform. Our dataset has balanced distributions of age and gender using the well-known IMDB-WIKI dataset as ground truth. We describe how our dataset is built and then compare several baseline methods, indicating its suitability for model evaluation.

연구 동기 및 목표

  • 인공지능 시스템의 쌍대 비교 모델 평가를 위한 대규모, 오픈, 균형 잡힌 데이터셋의 부족을 해결하기 위해.
  • 특히 순위 매기기 및 추천과 같은 주관적 작업에서의 공동 쌍대 비교 집계 알고리즘을 체계적으로 벤치마킹할 수 있도록 하기 위해.
  • 전체 및 하위 집단 성능 분석(예: 성별 또는 연령대 기반)을 지원하는 현실적이고 대규모의 평가 벤치마크를 제공하기 위해.
  • 노이즈가 많은 인간 선호도를 신뢰할 수 있는 순위로 집계하는 데 더 정확하고 강력한 모델 개발을 지원하기 위해.
  • 소규모 오픈 데이터셋과 대규모 전용 데이터셋 사이의 격차를 메우기 위해, 균형 잡힌 인구 통계 분포를 가진 공개 가능한 고품질 데이터셋을 제공하기 위해.

제안 방법

  • 나이(10–70세)와 성별 그룹 간 균형을 확보하기 위해, 각 나이-성별 조합에서 75장의 이미지를 샘플링하여 IMDB-WIKI 데이터셋에서 9,150장의 이미지를 유도하였다.
  • 브래드리-테리 모델 적용을 보장하기 위해 연결된 에르되시-레니 그래프를 구성하였으며, 250,249개의 쌍대 비교를 포함하였다. 간선을 무작위로 재배열하여 균일한 레이블 분포를 확보하였다.
  • 얼굴 자르기 이미지를 사용하여 톨로카 공동 작업 플랫폼에서 모든 쌍을 주석 처리하였으며, 제어 작업 및 작업자 필터링을 통한 품질 제어를 실시하였다.
  • 페이지당 세 가지 작업 레이아웃을 사용하여 하나의 제어 작업을 포함시켜 주석 품질을 유지하였으며, 페이지당 평균 23초의 작업 시간을 기록하였다.
  • 네 가지 기준 모델을 적용: 브래드리-테리(확률적 쌍대 비교 순위 매기기), 페이지랭크(그래프 기반 중심성), 랜덤(균일한 무작위 순위), 뒤집힌 기준값(신뢰도 검증용).
  • NDCG@k(정규화된 할인 누적 수익)를 사용하여 모델을 평가하였으며, 전체 평가에는 k=100, 하위 집단 분석에는 k=10을 사용하였다.

실험 결과

연구 질문

  • RQ1다양한 쌍대 비교 집계 모델의 성능은 대규모, 균형 잡힌, 오픈된 인간 선호도 데이터셋에서 어떻게 나타나는가?
  • RQ2쌍대 비교 작업에서 성능이 성별(남성 대 여성) 또는 연령대(예: 10대 대 50대)와 같은 인구 통계 하위 집단 간에 유의미하게 다를까?
  • RQ3비교 그래프의 구조(예: 연결된 그래프 대 비연결된 그래프)는 브래드리-테리와 같은 집계 모델의 성능에 어떤 영향을 미치는가?
  • RQ4IMDB-WIKI-SbS와 같은 대규모 오픈 데이터셋은 인공지능 시스템 내 인간 선호도 모델링의 의미 있는 벤치마킹을 지원할 수 있는가?
  • RQ5인간의 쌍대 판단에서 집단 간 비교와 집단 내 비교 중 어느 쪽이 더 어려운가, 그리고 이는 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 브래드리-테리 모델은 전체 IMDB-WIKI-SbS 데이터셋에서 NDCG@100 점수 0.859를 기록하여 무작위 기준값(0.490)을 크게 앞서는 성능을 보였다.
  • 연령대 간 성능에 차이가 있었으며, 브래드리-테리 모델은 [10;20] 연령대에서 가장 낮은 점수(0.358@10)를 기록했고, [50;60] 연령대에서 가장 높은 점수(0.681@10)를 기록하여, 젊은 연령대에서 비교가 더 어려운 것으로 나타났다.
  • 페이지랭크 모델은 [60;70] 연령대에서 NDCG@10 최고 점수 0.715를 기록하여, 노령 연령대에서 특정 비교 패tern에 더 강건할 수 있음을 시사한다.
  • 무작위 기준값은 [10;20] 연령대에서 브래드리-테리 및 페이지랭크를 모두 초월하여 성능을 냈으며, 이는 이 연령대에서 인간의 판단이 특히 노이즈가 많거나 일관성 없었음을 시사한다.
  • 뒤집힌 기준값 기준 모델은 모든 집단에서 거의 0에 가까운 NDCG 점수를 기록하여, 평가 설정이 잘못된 순위를 정확히 식별하고 있음을 확인하였다.
  • 남성 및 여성 하위 집단 간 유의미한 성능 차이가 관찰되지 않아, 이 데이터셋에서는 모델 성능이 성별 기반 편향에 대해 강건함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.