Skip to main content
QUICK REVIEW

[논문 리뷰] CrowdTruth 2.0: Quality Metrics for Crowdsourcing with Disagreement

Anca Dumitrache, Oana Inel|arXiv (Cornell University)|2018. 08. 18.
Mobile Crowdsensing and Crowdsourcing참고 문헌 5인용 수 8
한 줄 요약

이 논문은 군중지식을 통해 상호평가자 간 이견을 잡음이 아닌 핵심 신호로 모델링하는 CrowdTruth 2.0 프레임워크를 소개한다. 벡터화된 표현과 가중치가 부여된 이견 측도를 통해 작업자, 입력 미디어 단위, 애너테이션 간의 상호의존성을 명시적으로 모델링함으로써, 작업자, 애너테이션, 데이터 단위의 정확한 품질 평가가 가능해지며, 일치를 강제하기보다는 모호성을 유지한다.

ABSTRACT

Typically crowdsourcing-based approaches to gather annotated data use inter-annotator agreement as a measure of quality. However, in many domains, there is ambiguity in the data, as well as a multitude of perspectives of the information examples. In this paper, we present ongoing work into the CrowdTruth metrics, that capture and interpret inter-annotator disagreement in crowdsourcing. The CrowdTruth metrics model the inter-dependency between the three main components of a crowdsourcing system -- worker, input data, and annotation. The goal of the metrics is to capture the degree of ambiguity in each of these three components. The metrics are available online at https://github.com/CrowdTruth/CrowdTruth-core .

연구 동기 및 목표

  • 기존 군중지식 방법론이 상호평가자 간 이견을 잡음으로 간주하고 다수결 투표를 통해 일치를 강제하는 데서 비롯되는 한계를 해결하기 위해.
  • 군중지식 시스템의 세 핵심 구성요소인 작업자, 입력 미디어 단위, 애너테이션 간에 모호성이 어떻게 전파되는지를 모델링하기 위해.
  • 낮은 작업자 품질로 인한 이견과 본질적인 데이터 모호성으로 인한 이견을 구분할 수 있는 품질 측도를 개발하기 위해.
  • 서로 의존적이고 품질에 의해 가중치가 부여된 작업자, 애너테이션, 미디어 단위의 품질 점수를 체계적이고 반복적으로 계산하는 방법을 제공하기 위해.
  • 특히 모호하거나 개방형 시나리오에서 인간의 다양한 관점을 전체적으로 유지하기 위해.

제안 방법

  • 유한한 답변 공간 상에서 각 작업자의 미디어 단위에 대한 애너테이션을 이진 벡터로 표현하여 작업자 및 미디어 단위 벡터를 구성한다.
  • 폐쇄형 작업의 경우 답변 공간은 사전 정의되며, 개방형 작업의 경우 각 미디어 단위의 유일한 애너테이션들로부터 동적으로 유도된다.
  • 작업자 품질, 애너테이션 품질 등 관련 구성요소의 품질에 의해 가중된 코사인 거리 기반 이견 측도를 사용해 품질 점수를 계산한다.
  • 핵심 측도 정의: 작업자-작업자 일치도(WWA), 작업자-미디어 단위 일치도(WUA), 애너테이션 품질 점수(AQS), 미디어 단위-애너테이션 점수(UAS).
  • 수렴할 때까지 상호의존적인 루프를 통해 작업자, 애너테이션, 미디어 단위의 품질 점수를 반복적으로 재계산함으로써 품질 점수의 안정성을 확보하는 동적 프로그래밍 기반의 반복적 접근을 사용한다.
  • 모든 측도에서 가중 평균을 적용하여 저품질 작업자, 애너테이션, 또는 미디어 단위가 최종 점수에 미치는 영향을 최소화한다.

실험 결과

연구 질문

  • RQ1군중지식에서 상호평가자 간 이견을 잡음이 아닌 모호성의 신호로 의미적으로 해석할 수 있는가?
  • RQ2작업자, 애너테이션, 입력 미디어 단위의 품질을 상호의존성을 고려하여 함께 평가할 수 있는 정도는 어느 정도인가?
  • RQ3이견 인식 기반 측도가 모호하거나 개방형 작업에서 군중지식 기반 의미 애너테이션의 신뢰성을 향상시킬 수 있는가?
  • RQ4세 구성요소(작업자, 데이터, 애너테이션) 간에 모호성이 어떻게 전파되는가에 따라 이견의 해석은 어떻게 영향을 받는가?
  • RQ5구성요소의 품질에 의해 가중된 이견 측도가 최종 품질 점수에 미치는 영향은 어떠한가?

주요 결과

  • Crow드Truth 2.0 측도는 낮은 작업자 품질로 인한 이견과 입력 데이터의 진정한 모호성으로 인한 이견을 성공적으로 구분한다.
  • 품질 점수의 반복적 계산은 수렴에 도달하여 반복 간 변화의 합이 임계값 이하로 떨어지며, 이는 신뢰할 수 있는 측도 출력을 보장한다.
  • 애너테이션 품질 점수(AQS)는 동일한 애너테이션 세트가 모든 미디어 단위에 사용되는 폐쇄형 작업에만 적용 가능하며, 작업자 쌍 간의 일치 조건부 확률의 가중 평균으로 계산된다.
  • 작업자-작업자 일치도(WWA) 측도는 공유된 미디어 단위에서 한 작업자의 애너테이션과 다른 작업자들의 애너테이션 간 코사인 거리의 가중 평균을 사용하며, 가중치는 작업자 및 애너테이션 품질에 기반한다.
  • 작업자-미디어 단위 일치도(WUA) 측도는 공유된 단위에서 한 작업자의 애너테이션과 다른 모든 작업자들의 공식 일치 결과 간 유사도를 계산하며, 미디어 단위 및 애너테이션 품질에 의해 가중된다.
  • 미디어 단위-애너테이션 점수(UAS)는 주어진 미디어 단위에서 애너테이션이 얼마나 명확하게 표현되었는지를 측정하며, 해당 애너테이션을 선택한 자격을 갖춘 작업자 수의 가중 비율을 사용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.