Skip to main content
QUICK REVIEW

[논문 리뷰] Distinguishing Question Subjectivity from Difficulty for Improved Crowdsourcing

Yuan Jin, Mark Carman|arXiv (Cornell University)|2018. 02. 12.
Mobile Crowdsensing and Crowdsourcing참고 문헌 21인용 수 3
한 줄 요약

이 논문은 주관성과 난이도를 명시적으로 모델링하고 잠재적 작업자 선호도 요소를 통해 암묵적으로 주관성을 포착하는 확률적 프레임워크인 SDR(Subjectivity-and-Difficulty Response) 모델을 제안한다. 주관성의 변동성을 목적적 난이도와 구분함으로써, 다양한 커스터마이징된 데이터셋에서 정답 예측 및 작업자 응답 예측의 정확도를 향상시키며, 인간 검증된 순위 기반으로 질문의 난이도와 주관성에 대한 일관된 순서를 제공한다.

ABSTRACT

The questions in a crowdsourcing task typically exhibit varying degrees of difficulty and subjectivity. Their joint effects give rise to the variation in responses to the same question by different crowd-workers. This variation is low when the question is easy to answer and objective, and high when it is difficult and subjective. Unfortunately, current quality control methods for crowdsourcing consider only the question difficulty to account for the variation. As a result,these methods cannot distinguish workers personal preferences for different correct answers of a partially subjective question from their ability/expertise to avoid objectively wrong answers for that question. To address this issue, we present a probabilistic model which (i) explicitly encodes question difficulty as a model parameter and (ii) implicitly encodes question subjectivity via latent preference factors for crowd-workers. We show that question subjectivity induces grouping of crowd-workers, revealed through clustering of their latent preferences. Moreover, we develop a quantitative measure of the subjectivity of a question. Experiments show that our model(1) improves the performance of both quality control for crowd-sourced answers and next answer prediction for crowd-workers,and (2) can potentially provide coherent rankings of questions in terms of their difficulty and subjectivity, so that task providers can refine their designs of the crowdsourcing tasks, e.g. by removing highly subjective questions or inappropriately difficult questions.

연구 동기 및 목표

  • 기존의 품질 제어 방법이 주관성으로 인한 작업자 간 불일치를 난이도로 인한 오류와 혼동하는 한계를 해결하기 위해.
  • 질문의 주관성을 고정된 성질로 모델링하는 것이 아니라, 응답 패턴에 기반해 작업자를 군집화하는 잠재적 작업자 선호도 요소로 암묵적으로 모델링하기 위해.
  • 난이도와 주관성을 별도로 추정할 수 있는 통합된 확률적 프레임워크를 개발하여, 정답과 개인 작업자 응답 예측의 정확도를 향상시키기 위해.
  • 인간 평가와 일치하는 주관성의 정량적 측정치를 제공하기 위해.
  • 작업 제공자가 난이도가 너무 높거나 주관성이 높은 질문을 식별하고 개선할 수 있도록 작업 설계를 지원하기 위해.

제안 방법

  • SDR 모델은 각 질문에 대한 작업자 전문성과 선호도 요소를 나타내는 잠재 변수를 포함한 확률적 그래픽 모델을 사용한다.
  • 질문의 난이도는 정답 응답 확률에 직접적인 영향을 미치는 매개변수로 모델링된다.
  • 주관성은 부분적으로 주관적인 질문에 대한 응답 패턴에 기반해 작업자를 군집화하는 잠재 선호도 요소를 통해 암묵적으로 표현된다.
  • 모델은 베이지안 추론 기반 접근법을 사용하여 작업자 전문성, 선호도 요소, 질문의 난이도 및 주관성 매개변수를 동시에 추정한다.
  • 다중 선택 질문의 정답 상관관계 구조를 활용하여 추정 정확도와 군집 탐지 정확도를 향상시킨다.
  • 모델 추정치와 인간이 제공한 난이도 및 주관성 순위 간의 비교를 통해 모델의 해석 가능성과 타당성을 검증하는 새로운 공명도 평가 방법을 도입한다.

실험 결과

연구 질문

  • RQ1확률적 모델이 커스터마이징 작업에서 질문의 주관성으로 인한 작업자 간 불일치와 난이도로 인한 불일치를 효과적으로 구분할 수 있는가?
  • RQ2잠재적 작업자 선호도 요소를 통해 주관성을 암묵적으로 모델링할 수 있으며, 이는 작업자 간의 감지 가능한 군집화를 이끌어내는가?
  • RQ3기존 기준 모델 대비 SDR 모델이 정답 예측 및 개인 작업자 응답 예측의 정확도를 어느 정도 향상시키는가?
  • RQ4SDR 모델이 추정한 난이도 및 주관성 수치가 인간이 평가한 순위와 의미 있는 상관관계를 가지는가?
  • RQ5모델이 질문의 난이도 및 주관성 수준에 따라 질문을 식별하고 순위를 매김으로써 작업 설계를 지원할 수 있는가?

주요 결과

  • SDR 모델은 일곱 개의 부분적으로 주관적인 데이터셋에서 기존 다섯 가지 기준 모델보다 뛰어난 성능을 보이며, 평균 정확도에서 1.5~2.5%의 향상을 보였다.
  • Nemenyi 사후 검정을 통해 SDR와 다른 모든 모델(CDS, GLAD, DS, MdWC) 간의 성능 차이가 α=0.10 수준에서 통계적으로 유의미하다고 확인되었다.
  • 패션 데이터셋에서 SDR 모델은 미리 보지 않은 응답 예측 정확도 평균 0.7659를 기록했으며, 이는 다음으로 높은 성능을 보인 CDS 모델(0.7621)을 초월했다.
  • SDR가 추정한 주관성과 인간이 할당한 순위 간에 강한 음의 상관관계(r ≈ -0.85)가 관찰되어 주관성 측정의 타당성이 입증되었다.
  • 패션 판단 작업에서 모델은 세 개의 명확한 작업자 군집을 성공적으로 식별했으며, 이는 서로 다른 선호도 패턴을 반영하고 있어 주관성에 기인한 군집화가 발생했음을 시사한다.
  • 인간 평가자들이 제공한 난이도 및 주관성 순위는 SDR의 추정치와 강한 정상관관계를 보였으며, 난이도의 경우 r ≈ 0.82, 주관성의 경우 r ≈ 0.88의 상관계수를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.