Skip to main content
QUICK REVIEW

[논문 리뷰] Is Your Toxicity My Toxicity? Exploring the Impact of Rater Identity on Toxicity Annotation

Nitesh Goyal, Ian Kivlichan|arXiv (Cornell University)|2022. 05. 01.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 연구는 온라인 댓글의 독성 주석에 평가자의 신분이 미치는 영향을 조사하며, 아프리카계 미국인 또는 뜨거운 성적 소수자로 자가 정의한 개인들로 구성된 전문화된 평가자 풀이 제어 그룹과 비교해 유의미하게 다른 독성 평가를 산출하는 것으로 나타났다. 신분 기반 평가자로부터의 주석을 기반으로 훈련된 모델들은 더 큰 데이터셋을 사용한 무작위 평가자 기반 모델들조차도 능가하며, 이는 공동체가 자가 정의한 주석자가 더 세밀하고 포용적이며 편향이 적은 모델 성과를 낳는다는 것을 시사한다.

ABSTRACT

Machine learning models are commonly used to detect toxicity in online conversations. These models are trained on datasets annotated by human raters. We explore how raters' self-described identities impact how they annotate toxicity in online comments. We first define the concept of specialized rater pools: rater pools formed based on raters' self-described identities, rather than at random. We formed three such rater pools for this study--specialized rater pools of raters from the U.S. who identify as African American, LGBTQ, and those who identify as neither. Each of these rater pools annotated the same set of comments, which contains many references to these identity groups. We found that rater identity is a statistically significant factor in how raters will annotate toxicity for identity-related annotations. Using preliminary content analysis, we examined the comments with the most disagreement between rater pools and found nuanced differences in the toxicity annotations. Next, we trained models on the annotations from each of the different rater pools, and compared the scores of these models on comments from several test sets. Finally, we discuss how using raters that self-identify with the subjects of comments can create more inclusive machine learning models, and provide more nuanced ratings than those by random raters.

연구 동기 및 목표

  • 평가자의 자가 정의된 신분이 인터넷 댓글의 독성 주석에 영향을 미치는지 조사하기.
  • 아프리카계 미국인, 뜨거운 성적 소수자와 같은 신분 기반 집단에 기반한 전문화된 평가자 풀이 무작위 평가자보다 더 세밀하고 편향이 적은 주석을 제공하는지 평가하기.
  • 신분 기반 평가자로부터의 주석을 기반으로 훈련된 모델이 무작위 주석자 데이터를 기반으로 훈련된 모델보다 성능이 뛰어나지 않는지 평가하기.
  • 미래 연구를 위해 공개 가능한 382,500건의 주석을 포함한 세 가지 정제된 평가자 풀에서 유래한 데이터셋을 제작하고 배포하기.
  • 기계 학습 파ip라인에 신분 기반 주석자 풀을 통합하여 독성 탐지 모델의 편향을 줄이기 위한 권고를 제시하기.

제안 방법

  • 세 가지 전문화된 평가자 풀을 구성함: 자가 정의된 아프리카계 미국인, 뜨거운 성적 소수자, 또는 양쪽 모두가 아닌 자가 정의 그룹. 각 그룹은 Civil Comments 데이터셋의 동일한 25,500개 댓글을 주석화함.
  • 자기 신분 기반의 평가자 풀 프레임워크를 사용하여 주석을 수집함으로써, 민족적·성적 소수자 신분을 주요 분류 기준으로 삼음.
  • 통계 분석을 통해 평가자 풀 간 독성 평가를 비교하고, 평가자 신분에 따라 유의미한 차이가 있음을 확인함.
  • 다른 풀 간 높은 불일치를 보인 댓글을 분석하여 불일치의 언어적 및 맥락적 지표를 규명함.
  • 각 평가자 풀의 주석을 기반으로 여러 기계 학습 모델을 훈련하고, 다양한 테스트 세트에서 성능을 평가하여 비교함.
  • 이 연구는 세 가지 전문화된 평가자 풀에서 유래한 382,500건의 주석을 포함한 새로운 데이터셋을 배포하여 복제 및 향후 연구를 지원함.

실험 결과

연구 질문

  • RQ1평가자의 자가 정의된 신분이 인종 및 성적 소수자 관련 댓글의 독성 주석에 유의미하게 영향을 미치는가?
  • RQ2아프리카계 미국인, 뜨거운 성적 소수자와 같은 신분 기반 평가자 풀의 독성 평가가 제어 그룹(아프리카계 미국인이 아니며 뜨거운 성적 소수자도 아님)과 어떻게 다를까?
  • RQ3무작위 평가자 데이터를 기반으로 훈련된 모델과 비교해, 전문화된 평가자 풀의 주석을 기반으로 훈련된 모델이 더 작은 데이터셋이라도 성능이 뛰어나지 않는가?
  • RQ4전문화된 평가자 풀과 제어 그룹 간 평가 차이를 설명하는 언어적 또는 맥락적 특징는 무엇인가?
  • RQ5신분 기반 평가자 풀은 독성 탐지 모델의 공정성과 포용성을 어떻게 향상시킬 수 있는가?

주요 결과

  • 평가자의 신분은 독성 주석에서 통계적으로 유의미한 요소였으며, 아프리카계 미국인 및 뜨거운 성적 소수자 평가자들이 신분 관련 댓글에 대해 제어 그룹과 다른 평가를 내렸다.
  • 정체성 공격, 위협, 불결한 어휘 등의 카테고리에서 전문화된 평가자 풀과 제어 그룹 간 평가 차이가 가장 뚜렷했다.
  • 전문화된 평가자 풀에서 주석을 기반으로 훈련된 모델들이 더 큰 데이터셋을 사용한 무작위 평가자 기반 모델들보다 성능이 뛰어나, 더 높은 품질과 더 세밀한 주석이 이루어졌음을 시사한다.
  • 이 연구에서 제작한 382,500건의 주석을 포함한 데이터셋은 향후 연구 및 모델 평가를 위해 공개됨.
  • 초기 내용 분석 결과, 미세한, 공동체 특화된 언어적 지표(예: 마이크로아그레션)는 신분 기반 평가자가 더 정확하게 식별함을 확인함.
  • 연구 결과는 공동체가 자가 정의한 주석자를 참여시킴으로써 독성 탐지 모델의 포용성과 편향 감소에 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.