Skip to main content
QUICK REVIEW

[논문 리뷰] Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive

Tharindu Cyril Weerasooriya, Sujan Dutta|arXiv (Cornell University)|2023. 01. 29.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 정치적 논의에서 인간 및 기계 모더레이터 간의 공격적 발언 분류에 대한 불일치를 연구하기 위해 대규모 노이즈 감사와 새로운 개념인 유착 공격( vicarious offense )을 도입한다. 연구 결과, 모더레이션 결과에 광범위한 변동성이 존재하며, 인간과 대규모 언어 모델 모두 다른 정치 성향을 가진 사람들, 특히 그들과의 정치적 입장이 다를 경우 공격적 콘텐츠를 어떻게 인식할지 예측할 수 없다는 점을 보여준다.

ABSTRACT

Offensive speech detection is a key component of content moderation. However, what is offensive can be highly subjective. This paper investigates how machine and human moderators disagree on what is offensive when it comes to real-world social web political discourse. We show that (1) there is extensive disagreement among the moderators (humans and machines); and (2) human and large-language-model classifiers are unable to predict how other human raters will respond, based on their political leanings. For (1), we conduct a noise audit at an unprecedented scale that combines both machine and human responses. For (2), we introduce a first-of-its-kind dataset of vicarious offense. Our noise audit reveals that moderation outcomes vary wildly across different machine moderators. Our experiments with human moderators suggest that political leanings combined with sensitive issues affect both first-person and vicarious offense. The dataset is available through https://github.com/Homan-Lab/voiced.

연구 동기 및 목표

  • 소셜 미디어에서 정치적 논의에 대한 공격적 발언을 식별하는 데 있어 인간 및 기계 모더레이터 간의 불일치 정도를 조사하기 위해.
  • 통제된 데이터셋을 초월한 대규모 실세계 평가의 부족을 해결하기 위해.
  • 유착 공격( vicarious offense ) 개념을 도입하기 위해 — 즉, 개인이 다른 정치적 신분을 가진 사람들이 공격적인 콘텐츠를 어떻게 느낄지 인식하는 방식.
  • 정치 성향이 제1인칭 및 유착 공격에 대한 인식에 영향을 미치는지 평가하기 위해.
  • 대규모 언어 모델과 전통적 분류기의 공격적 발언 판단에 대한 인간 간 불일치를 예측할 수 있는 능력을 평가하기 위해.

제안 방법

  • 정치적 이견이 알려진 대규모 유튜브 댓글 데이터셋을 대상으로, 9개의 기계 모더레이터(예: GPT-3.5 포함된 대규모 언어 모델 및 비-LLM 모델 포함)와 인간 평가자들을 활용해 노이즈 감사를 수행함.
  • 구조화된 프롬프트 형식을 사용해 제1인칭(개인적) 및 유착 공격 인식에 대한 인간의 주석을 수집함: '[partyA]가 이 댓글을 얼마나 공격적으로 느낄 것이라고 생각하나요?'.
  • 다수결 투표를 통해 기계 및 인간 모더레이터의 판단을 집계하여, 다양한 시스템과 정치 집단 간 비교를 가능하게 함.
  • 대통령, 공화당, 무소속 성향의 시각에서 인간 레이블링된 유착 공격 주석을 포함한 VOICED 데이터셋을 도입함 — 이는 유사한 사례가 없는 첫 번째 데이터셋임.
  • F1, 정밀도, 재현율 등의 지표를 사용해 모델 성능을 평가하며, 인간 공감대에 비해 대규모 언어 모델(GPT-3.5 등)과 비-LLM 분류기(Perspective API, Detoxify 등)의 성능을 비교함.
  • 카하네만 등이 제안한 노이즈 감사 프레임워크를 응용하여, 숙련된 의사결정 체계 간 결과 변동성을 측정함. 각 모더레이터를 별개의 의사결정자로 간주함.
Figure 1: An illustrative example from YouTube comments on CNN news videos highlighting nuanced inconsistencies between machine moderators and human moderators with different political leanings. We use the majority vote to aggregate individual machine and human moderator’s verdicts. Here a green che
Figure 1: An illustrative example from YouTube comments on CNN news videos highlighting nuanced inconsistencies between machine moderators and human moderators with different political leanings. We use the majority vote to aggregate individual machine and human moderator’s verdicts. Here a green che

실험 결과

연구 질문

  • RQ1공격적 정치 논의를 라벨링하는 데 있어 인간 및 기계 모더레이터 간에 얼마나 많은 불일치가 존재하는가?
  • RQ2정치 성향이 제1인칭 및 유착 공격에 대한 인식에 어느 정도 영향을 미치는가?
  • RQ3대규모 언어 모델이 다른 사람, 특히 정반대 정치 성향을 가진 사람들이 공격적 콘텐츠를 어떻게 판단할지 정확히 예측할 수 있는가?
  • RQ4기계 모더레이터의 성능은 제 personal 및 유착 공격 식별에서 인간 모더레이터와 비교해 어떻게 다른가?
  • RQ5유착 공격 개념이 인간 및 기계 간의 공격적 발언 탐지 불일치를 통합적으로 이해하는 데 기여할 수 있는가?

주요 결과

  • 인간 및 기계 모더레이터 간에 공격적 콘텐츠 라벨링에 광범위한 불일치가 존재하며, 유명한 분류기 간에도 결과에 높은 변동성이 존재함.
  • 기계 모더레이터(GPT-3.5 및 비-LLM 모델 포함)는 뚜렷한 일관성 부족을 보이며, 인간 공감대와 높은 일치를 보이는 단일 모델이 없음.
  • 다른 정치 성향을 가진 인간 모더레이터는 개인적 공격성뿐만 아니라 유착 공격성에 대해서도 불일치를 보이며, 정치적 균열이 개인 경험을 초월해 느껴지는 공격성에 영향을 미친다는 점을 시사함.
  • ChatGPT와 같은 대규모 언어 모델은 유착 공격성을 예측하는 데 제한된 능력을 보이며, 인간 평가자와의 일치도 낮고, 기계 모더레이터 다수결과 더 높은 일치를 보이며 주관적 인식을 모델링하는 데 어려움을 드러냄.
  • 연구 결과, 정치 정체성이 제1인칭 및 유착 공격성 인식에 상당한 영향을 미치며, 무소속자들은 종종 중간 지점으로서 기능하는 반면, 민주당과 공화당은 판단에서 갈라짐.
  • 통제된 주석 파이프라인을 통해 수집된 VOICED 데이터셋은 유착 공격 연구를 위한 새로운 벤치마크를 제공하며, 향후 연구를 위해 공개되어 있음.
(a) Temporal trend showing number of comments made about news videos on three news networks’ official YouTube channels over time.
(a) Temporal trend showing number of comments made about news videos on three news networks’ official YouTube channels over time.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.