Skip to main content
QUICK REVIEW

[논문 리뷰] NLPositionality: Characterizing Design Biases of Datasets and Models

Sebastin Santy, Jenny T. Liang|arXiv (Cornell University)|2023. 06. 02.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

NLPositionality는 다양한 글로벌 지역의 자원자들이 제공한 주석과 데이터셋 레이블 또는 모델 예측 간의 일치도를 측정하여 NLP 데이터셋과 모델의 설계 편향을 정량화하는 프레임워크를 제안한다. 연구 결과, 데이터셋과 모델은 서양계, 백인, 대학 졸업자, 청소년층과 가장 높은 일치도를 보이며, 성별에 관계없이 비이원성인 개인과 비모국어 사용자는 체계적으로 소외됨을 드러낸다.

ABSTRACT

Design biases in NLP systems, such as performance differences for different populations, often stem from their creator's positionality, i.e., views and lived experiences shaped by identity and background. Despite the prevalence and risks of design biases, they are hard to quantify because researcher, system, and dataset positionality is often unobserved. We introduce NLPositionality, a framework for characterizing design biases and quantifying the positionality of NLP datasets and models. Our framework continuously collects annotations from a diverse pool of volunteer participants on LabintheWild, and statistically quantifies alignment with dataset labels and model predictions. We apply NLPositionality to existing datasets and models for two tasks -- social acceptability and hate speech detection. To date, we have collected 16,299 annotations in over a year for 600 instances from 1,096 annotators across 87 countries. We find that datasets and models align predominantly with Western, White, college-educated, and younger populations. Additionally, certain groups, such as non-binary people and non-native English speakers, are further marginalized by datasets and models as they rank least in alignment across all tasks. Finally, we draw from prior literature to discuss how researchers can examine their own positionality and that of their datasets and models, opening the door for more inclusive NLP systems.

연구 동기 및 목표

  • 연구자, 데이터셋, 모델의 위치성에 기인한 NLP 시스템의 설계 편향을 정량화할 수 있는 도구 부족 문제를 해결하기 위해.
  • 다양한 인구 집단과의 일치도를 측정할 수 있는 확장 가능하고 연속적이며 포괄적인 방법을 개발하기 위해.
  • 기존 데이터셋과 모델의 체계적 편향, 특히 사회적 수용성 및 혐오 발언 탐지 작업에서의 편향을 폭 드러내고 특성화하기 위해.
  • NLP 연구 분야에서 위치성의 중요성을 환기시키고 연구자들이 자신의 위치 배경뿐 아니라 시스템의 위치 배경을 점검하도록 유도하기 위해.

제안 방법

  • LabintheWild 플랫폼을 활용해 87개 국가에서 온 1,096명의 다양한 주석자들을 확보하여 지속적인 주석 수집을 수행한다.
  • 원래 데이터셋 또는 모델 레이블과 일치하는 표준화된 리커트 척도 평가를 사용해 사회적 수용성 및 독성에 대한 주석을 수집한다.
  • 주석자 인구 통계적 배경과 데이터셋/모델 출력 간의 일치도를 상관계수 및 일致도 측정 지표를 통해 통계적으로 정량화한다.
  • 재학습이나 모델 접근 권한 없이도 기존 데이터셋과 모델(예: GPT-4 포함)에 대해 사후적으로 프레임워크를 적용한다.
  • 국적, 교육 수준, 연령, 성별 정체성 등의 자기 보고 기반 인구 통계 정보를 활용해 다양한 정체성 집단 간의 위치성 영향을 분석한다.
  • 데이터 품질 향상과 장기적인 지속 가능한 데이터 수집을 위해 보상보다는 참가 동기와 학습 기회를 우선시한다.

실험 결과

연구 질문

  • RQ1NLP 데이터셋과 모델은 다양한 글로벌 지역 출신 주석자들의 인구 통계적 배경과 얼마나 일치하는가?
  • RQ2NLP 시스템의 설계 편향은 그 제작자와 원래 주석자들의 위치성과 어느 정도 반영되는가?
  • RQ3어느 인구 집단이 데이터셋 레이블과 모델 예측과 가장 낮은 일치도를 보이며 체계적 소외를 경험하는가?
  • RQ4지속적이고 자원자 기반의 주석 프레임워크가 NLP 시스템의 진화하는 위치성을 효과적으로 캡처할 수 있는가?
  • RQ5GPT-4와 같은 모델의 위치성은 미세조정된 모델과 데이터셋과 비교해 어떻게 다른가?

주요 결과

  • 총 16,299건의 주석이 87개 국가에서 온 1,096명의 주석자들로부터 수집되었으며, 1년 이상 동안 일일 평균 38건의 주석이 생성되었다.
  • 데이터셋과 모델은 서양계, 백인, 대학 졸업자, 청소년층과 가장 높은 일치도를 보이며, WEIRD(서양계, 교육 수준 높음, 산업화, 부유, 민주주의) 인구 집단의 특성과 일치한다.
  • 비이원성 개인과 비모국어 사용자는 모든 작업에서 데이터셋 레이블 및 모델 예측과 가장 낮은 일치도를 보이며 체계적 소외가 확인된다.
  • 원래 데이터셋 주석자들은 자신의 레이블과 강한 일치도를 보이며, 제작자의 위치성이 데이터셋 편향 형성에 기여하는 바를 확인한다.
  • 이 프레임워크는 미세조정된 모델과 일반 목적의 대규모 언어 모델(GPT-4 포함) 모두에서 위치성 패턴을 성공적으로 특정하며, 권리가 있는 인구 집단과의 일관된 일치도를 드러낸다.
  • 이 연구는 LabintheWild와 같은 플랫폼에서 지속적이고 동기 기반의 주석 수집이 보상 기반의 대규모 인력 동원보다 더 높은 품질의 데이터를 생성하며, 설계 편향의 장기적 모니터링을 가능하게 한다는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.