Skip to main content
QUICK REVIEW

[논문 리뷰] The 'Problem' of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation

Barbara Plank|arXiv (Cornell University)|2022. 11. 04.
Machine Learning and Data Classification인용 수 9
한 줄 요약

이 논문은 인간 레이블 변동성—주관성, 모호성 또는 다수의 타당한 해석으로 인한 타당한 의견 차이—을 소음이 아닌 정보성 데이터로 간주해야 한다고 주장한다. 인간 레이블 변동성을 전 과정에 걸쳐 유지하는 데이터셋의 모델링, 평가 및 코딩을 위한 통합 프레임워크를 제안하며, 다수 투표를 넘어서 연구를 가능하게 하기 위해 공개된 데이터셋 중 집계되지 않은(annotation) 레이블을 포함한 공동으로 유지되는 포괄적인 레포지터리를 소개한다.

ABSTRACT

Human variation in labeling is often considered noise. Annotation projects for machine learning (ML) aim at minimizing human label variation, with the assumption to maximize data quality and in turn optimize and maximize machine learning metrics. However, this conventional practice assumes that there exists a ground truth, and neglects that there exists genuine human variation in labeling due to disagreement, subjectivity in annotation or multiple plausible answers. In this position paper, we argue that this big open problem of human label variation persists and critically needs more attention to move our field forward. This is because human label variation impacts all stages of the ML pipeline: data, modeling and evaluation. However, few works consider all of these dimensions jointly; and existing research is fragmented. We reconcile different previously proposed notions of human label variation, provide a repository of publicly-available datasets with un-aggregated labels, depict approaches proposed so far, identify gaps and suggest ways forward. As datasets are becoming increasingly available, we hope that this synthesized view on the 'problem' will lead to an open discussion on possible strategies to devise fundamentally new directions.

연구 동기 및 목표

  • 인간 레이블 변동성을 소음으로 간주하는 전통적 가정을 도전하며, 이를 인간 해석의 진정한 다양성의 반영으로 주장한다.
  • 레이블 변동성, 이견, 모호성 등의 분산된 개념들을 '인간 레이블 변동성'(Hlv)이라는 용어로 통합한다.
  • Hlv를 간과할 경우 NLP 및 머신러닝 분야의 데이터 코딩, 모델 개발, 평가에서 진전이 제한됨을 입증한다.
  • 다수 투표를 넘어서는 연구를 지원하기 위해 집계되지 않은 인간 레이블을 포함한 데이터셋을 중앙집중식으로 관리하는 공동체 기반 레포지터리를 제공한다.
  • 인간의 다양성을 반영하는 시스템 모델링 및 평가로의 패러다임 전환을 주장함으로써, 인간 중심 AI의 포괄성과 신뢰성 향상을 도모한다.

제안 방법

  • 모호성, 주관성 또는 다수의 타당한 답이 존재하는 경우 발생하는 인간 레이블의 타당한, 오류 기반 외의 변동성을 '인간 레이블 변동성'(Hlv)으로 정의하고 도입한다.
  • 기존 문헌에서 산발적으로 다뤄진 개념들—예: 이견, 주관성, 다수의 타당한 답—을 Hlv의 통합 프레임워크 아래 통합한다.
  • 세 단계로 구성된 프레임워크를 제안한다: (1) 집계되지 않은 레이블을 유지하는 데이터 코딩, (2) 단일 골드 레이블이 아닌 레이블 분포를 고려하는 모델링, (3) 단일 기준 레이블이 아닌 다수의 기준 레이블을 사용한 평가.
  • NLP, CV, NLI 작업에서의 사례를 포함해, 집계되지 않은 인간 레이블을 포함한 공개된 데이터셋을 코딩하고 유지 관리한다.
  • 기존 데이터셋(예: Phrase Detectives, GoEmotions, ChaosNLI, CommitmentBank)을 활용해 Hlv의 실질적 적용 사례를 제시하고 프레임워크의 타당성을 검증한다.
  • 공동 과제(예: SemEval 2023 LeWiDi)에 통합하거나 다수 투표 기반 평가와의 비교를 통해 Hlv 인식 방법의 도입을 장려한다.

실험 결과

연구 질문

  • RQ1인간 레이블 변동성은 머신러닝 파이프라인에서 데이터 품질, 모델 성능, 평가 지표에 어떤 영향을 미치는가?
  • RQ2인간 레이블 변동성과 레이블 오류는 무엇이 다른가? 이 구분이 모델 개발에 있어 왜 필수적인가?
  • RQ3다수의 인간 레이블로 학습된 모델이 모호하거나 주관적인 작업에서 다수 투표 기반 골드 레이블로 학습된 모델보다 성능이 뛰어나게 되는가?
  • RQ4인간 레이블 변동성을 유지하고 연구할 수 있도록 데이터셋을 어떻게 코딩하고 공유할 수 있는가?
  • RQ5여러 개의 인간 레이블이 타당한 상황에서 모델을 공정하게 평가하기 위해 어떤 새로운 평가 프로토콜이 필요한가?

주요 결과

  • 인간 레이블 변동성은 NLP 및 CV 작업에서 널리 퍼져 있으며, 특히 독성 탐지, 정서 인식, 어휘의 의미 해석 분리 등 주관적 또는 모호한 작업에서 두드러진다.
  • Phrase Detectives, GoEmotions, ChaosNLI, CommitmentBank 등 집계되지 않은 레이블을 포함한 상당수의 데이터셋이 공개되어 있으며, Hlv 연구를 지원한다.
  • 기존 벤치마크 및 공동 과제(예: SemEval 2023 LeWiDi)는 Hlv 인식 평가를 이미 일부 통합하여 공동체의 관심과 실현 가능성을 보여주고 있다.
  • ChaosNLI 및 Phrase Detectives와 같은 데이터셋은 잘 정의된 작업에서도 조사자 간 조율할 수 없는 이견이 20–30%에 이르며, 이는 상당한 수준의 Hlv 존재를 시사한다.
  • 단일 골드 레이블이 아닌 레이블 분포를 기반으로 학습된 모델은 최근 TACL 및 JAIR 논문에서 보여주듯이, 높은 모호성의 작업에서 더 뛰어난 내재성과 일반화 능력을 보인다.
  • Hlv 데이터셋 레포지터리(https://github.com/mainlp/awesome-human-label-variation)는 이미 다수의 영향력 있는 연구에서 활용되어 실용성과 공동체 수용도를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.