Skip to main content
QUICK REVIEW

[논문 리뷰] When is it Better to Compare than to Score?

Nihar B. Shah, Sivaraman Balakrishnan|arXiv (Cornell University)|2014. 06. 25.
Meta-analysis and systematic reviews참고 문헌 23인용 수 18
한 줄 요약

이 논문은 인간으로부터 데이터를 수집할 때 쌍별 비교(순서 척도) 측정이 직접 점수 부여(정수 척도)보다 언제 더 우수한지 조사한다. 아마존 메카니컬 터크에서 실시한 실험과 투르스톤 및 브래드리-테일러-루스 모델에 대한 이론적 분석을 통해, 순서 척도 방법이 표본당 노이즈를 감소시키고 노이즈가 충분히 낮을 경우 추정 오차를 낮춘다는 것을 보여주며, 정수 척도와 순서 척도 중에서 어떤 것을 선택할지에 대한 데이터 기반 지침을 제공한다.

ABSTRACT

When eliciting judgements from humans for an unknown quantity, one often has the choice of making direct-scoring (cardinal) or comparative (ordinal) measurements. In this paper we study the relative merits of either choice, providing empirical and theoretical guidelines for the selection of a measurement scheme. We provide empirical evidence based on experiments on Amazon Mechanical Turk that in a variety of tasks, (pairwise-comparative) ordinal measurements have lower per sample noise and are typically faster to elicit than cardinal ones. Ordinal measurements however typically provide less information. We then consider the popular Thurstone and Bradley-Terry-Luce (BTL) models for ordinal measurements and characterize the minimax error rates for estimating the unknown quantity. We compare these minimax error rates to those under cardinal measurement models and quantify for what noise levels ordinal measurements are better. Finally, we revisit the data collected from our experiments and show that fitting these models confirms this prediction: for tasks where the noise in ordinal measurements is sufficiently low, the ordinal approach results in smaller errors in the estimation.

연구 동기 및 목표

  • 인간으로부터의 데이터 수집을 위한 정수 척도(수치 점수 부여)와 순서 척도(쌍별 비교) 방법 중에서 어느 것이 더 바람직한지에 대한 모호성을 해결하기 위해.
  • 다양한 작업에서 정수 척도 대비 순서 척도 측정 방식의 표본당 노이즈 수준을 경험적으로 정량화하기 위해.
  • 순서 척도 데이터에 대해 투르스톤 및 브래드리-테일러-루스(Bradley-Terry-Luce, BTL) 모델 하에서 최소 최대 추정 오차율을 이론적으로 특성화하기 위해.
  • 순서 척도 측정이 정수 척도 측정보다 더 낮은 추정 오차를 낳는 조건을 유도하기 위해.
  • 경험적 노이즈 수준과 비교 그래프의 구조를 바탕으로 측정 체계를 선택하는 데 실용적인 지침을 제공하기 위해.

제안 방법

  • 다양한 작업에서 아마존 메카니컬 터크를 활용해 대규모 인간 실험을 실시하여 정수 척도와 순서 척도 측정 방식 간의 노이즈 수준을 비교하였다.
  • 쌍별 비교의 확률적 관계를 수식화하기 위해 투르스톤 케이스 V 모델과 브래드리-테일러-루스(Bradley-Terry-Luce, BTL) 모델을 적용하였다.
  • 통계적 결정 이론을 사용하여 정수 척도 및 순서 척도 모델 하에서의 최소 최대 오차 경계를 유도하였다.
  • 비교 그래프의 구조(즉, 어떤 항목 쌍이 비교되었는지)를 반영한 구조 인식 오차 경계를 도입하였다.
  • 실제 실험 데이터에 이론 모델을 적합시켜 추정 정확도에 대한 예측의 타당성을 검증하였다.
  • 데이터 처리 부등식을 이론적 기준으로 사용하였지만, 인간으로부터의 데이터 수집에서 노이즈 특성이 다르므로 직접 적용되지 않음을 보였다.

실험 결과

연구 질문

  • RQ1인간으로부터의 데이터 수집에서 쌍별 비교가 직접 정수 척도 부여보다 더 낮은 추정 오차를 낳는 조건은 무엇인가?
  • RQ2실세계 작업 전반에서 정수 척도 측정의 표본당 노이즈는 순서 척도 측정의 표본당 노이즈와 비교해 어떻게 되는가?
  • RQ3투르스톤 및 BTL 모델 하에서 쌍별 비교를 사용하여 알려지지 않은 양을 추정할 때 이론적 최소 최대 오차율은 얼마인가?
  • RQ4비교 그래프의 구조(즉, 어떤 항목 쌍이 비교되었는지)는 순서 척도 설정에서 추정 오차에 어떤 영향을 미치는가?
  • RQ5몇 개의 기준값 샘플을 통해 경험적으로 노이즈를 추정하면, 순서 척도 측정이 정수 척도 측정보다 바람직한지 신뢰성 있게 예측할 수 있는가?

주요 결과

  • 경험적 결과로, 다양한 작업 전반에서 정수 척도 측정의 표본당 노이즈가 순서 척도 측정보다 유의미하게 높게 나타났다.
  • 순서 척도 측정은 정보량이 적음에도 불구하고 일반적으로 더 빠르고 표본당 노이즈가 적어, 정수 척도 측정보다 더 낮은 노이즈를 보였다.
  • 이론적 분석 결과, 순서 척도 측정의 노이즈가 충분히 낮을 경우, 순서 척도 방법이 정수 척도 방법보다 더 낮은 최소 최대 추정 오차를 달성함을 보였다.
  • 투르스톤 및 BTL 모델을 실험 데이터에 적합시켜, 순서 척도 측정의 노이즈가 낮을 경우 순서 척도 기반 추정치가 더 정확하다는 것이 확인되었다.
  • 구조 인식 오차 경계는 추정 오차가 비교 그래프의 스펙트럼 성질에 따라 달라지며, 더 잘 연결된 그래프일수록 오차가 낮아짐을 보여주었다.
  • 논문은 실용적 지침을 제공한다: 기준값 샘플 몇 개를 사용해 두 모odal 방식의 노이즈를 추정하고, 순서 척도의 노이즈가 충분히 낮을 경우 그 방법을 선호하라.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.