Skip to main content
QUICK REVIEW

[논문 리뷰] Designing Toxic Content Classification for a Diversity of Perspectives

Deepak Kumar, Patrick Gage Kelley|arXiv (Cornell University)|2021. 06. 04.
Hate Speech and Cyberbullying Detection참고 문헌 38인용 수 11
한 줄 요약

이 논문은 17,280명의 다양한 배경과 경험을 가진 참가자들로부터 수집한 설문 데이터를 바탕으로, 개인별 시각에 맞춰 분류기 임계값을 조정하여 평균 86% 향상된 정확도를 달성하는 개인화된 독성 분류 모델을 제안한다. 이는 일률적인 분류기(예: Perspective API)가 소수자 집단을 포함한 다양한 사용자들의 독성 인식에 따라 일반화되지 못함을 보여준다.

ABSTRACT

In this work, we demonstrate how existing classifiers for identifying toxic comments online fail to generalize to the diverse concerns of Internet users. We survey 17,280 participants to understand how user expectations for what constitutes toxic content differ across demographics, beliefs, and personal experiences. We find that groups historically at-risk of harassment - such as people who identify as LGBTQ+ or young adults - are more likely to to flag a random comment drawn from Reddit, Twitter, or 4chan as toxic, as are people who have personally experienced harassment in the past. Based on our findings, we show how current one-size-fits-all toxicity classification algorithms, like the Perspective API from Jigsaw, can improve in accuracy by 86% on average through personalized model tuning. Ultimately, we highlight current pitfalls and new design directions that can improve the equity and efficacy of toxic content classifiers for all users.

연구 동기 및 목표

  • 다양한 배경, 경험, 신념이 온라인 독성 인식에 어떻게 영향을 미치는지 조사하기 위해.
  • Perspective API와 같은 일률적 독성 분류기가 다양한 사용자 인식을 포괄하지 못하는 한계를 규명하기 위해.
  • 학대 경험과 민족적 정체성이 독성 판단에 어떤 영향을 미치는지 평가하기 위해.
  • 다양한 사용자 집단에서 정확도를 향상시키는 데 기여하는 개인화된 조정 전략을 개발하고 테스트하기 위해.
  • 미래의 독성 분류 연구를 지원하기 위해 공개 가능한 데이터셋과 방법론적 최선의 실천 방안을 제공하기 위해.

제안 방법

  • Mechanical Turk를 통해 미국 거주자 17,280명을 대상으로 대규모 설문 조사 실시. 참가자들은 Reddit, Twitter, 4chan에서 무작위로 선택된 20개의 댓글을 독성 여부에 대해 평가함.
  • 인구통계학적 데이터, 온라인 괴롭힘 경험, 콘텐츠 필터링에 대한 태도를 수집하여 영향 요인 분석.
  • 비용과 레이블 정확도의 균형을 맞추기 위해 댓글당 5점 척도를 사용. 향후 커뮤니티 기반 레이블링에 대한 최선의 실천 방안으로 정립.
  • 참가자 공감도를 기준으로 기존 분류기(예: Perspective API, Instagram의 nudge)의 성능을 평가하여, 높은 신뢰도 임계값에서도 50%의 경우에서 심각한 불일치가 발생함을 확인.
  • 사용자 개인 또는 인구통계학적 집단별로 개인화된 임계값 조정 전략을 제안하여 분류기의 사용자 인식과의 일치도 향상.
  • 개인 및 인구통계학적 집단별로 정확도 지표를 사용하여 성능 향상을 측정하고, 글로벌 임계값과 개인화된 임계값 간 비교 분석.

실험 결과

연구 질문

  • RQ1민족적 정체성, 괴롭힘 경험, 콘텐츠 필터링에 대한 태도가 사용자들이 온라인 독성에 대해 어떻게 인식하는지에 영향을 미치는가?
  • RQ2Perspective API와 같은 일률적 독성 분류기가 다양한 사용자 판단과 얼마나 일치하는가?
  • RQ3개인화된 임계값 조정이 개인 사용자의 독성 분류 정확도를 크게 향상시킬 수 있는가?
  • RQ4커뮤니티 기반 연구에서 정교하고 맥락에 민감한 독성 판단을 캡처하기 위한 가장 효과적인 레이블링 실천 방식은 무엇인가?
  • RQ5다양한 온라인 커뮤니티(예: Reddit, Twitter, 4chan)와 사용자 집단 간 독성 분류기 성능은 어떻게 다를까?

주요 결과

  • 참가자들 중 53%가 댓글을 '독성이 없음'으로, 39%는 '약간' 또는 '중간 정도' 독성으로, 8%는 '매우' 또는 '극도로' 독성으로 평가하여 평가자 간 심각한 불일치가 있음을 시사함.
  • 참가자들이 독성에 대해 일관되게 동의하더라도, 85%의 댓글에서 어느 정도의 불일치가 발생함을 확인하여 이 작업의 주관성 강도를 입증함.
  • Lesbian, Gay, Bisexual, Transgender, Queer 또는 Questioning(LGBTQ+)로 자신을 정의하는 참가자들은 댓글을 독성으로 평가할 가능성이 1.64배 더 높았고, 괴롭힘을 자주 목격한 참가자들은 22% 더 낮은 가능성이 있었음(오즈 비율 0.78). 이는 감각 둔화 효과를 시사함.
  • Perspective API가 90%의 신뢰도를 기준으로 하더라도, 참가자 중 50%만 이 분류 결과에 동의함을 확인하여 사용자 인식과의 심각한 불일치를 드러냄.
  • 개인화된 분류기 임계값 조정으로 개인별 평균 정확도가 86% 향상되었으며, 연령별 모델은 가장 높은 성과를 보였음(최대 20.6% 향상).
  • 이 연구는 향후 연구 및 모델 개발을 지원하기 위해 107,620개의 댓글에 대해 17,280건의 독성 평가를 포함한 공개 데이터셋을 제공함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.