Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Twitter Corpus and Baselines for Evaluating Demographic Bias in Hate Speech Recognition

Xiaolei Huang, Linzi Xing|arXiv (Cornell University)|2020. 02. 24.
Hate Speech and Cyberbullying Detection참고 문헌 48인용 수 44
한 줄 요약

이 논문은 영어, Italian, Polish, Portuguese, Spanish에 걸친 저자 수준의 인구통계 속성(연령, 국가, 성별, 인종)을 포함한 다국어 Twitter 혐오 발언 말뭉치를 제시하고, 성능 및 형평성을 평가하기 위한 베이스라인 분류기를 평가하는 한편 언어-인구통계 변이를 분석한다.

ABSTRACT

Existing research on fairness evaluation of document classification models mainly uses synthetic monolingual data without ground truth for author demographic attributes. In this work, we assemble and publish a multilingual Twitter corpus for the task of hate speech detection with inferred four author demographic factors: age, country, gender and race/ethnicity. The corpus covers five languages: English, Italian, Polish, Portuguese and Spanish. We evaluate the inferred demographic labels with a crowdsourcing platform, Figure Eight. To examine factors that can cause biases, we take an empirical analysis of demographic predictability on the English corpus. We measure the performance of four popular document classifiers and evaluate the fairness and bias of the baseline classifiers on the author-level demographic attributes.

연구 동기 및 목표

  • 공정성 평가를 가능하게 하기 위해 저자 수준의 인구통계 속성이 주석으로 달린 다국어 혐오 발언 말뭉치를 생성한다.
  • 공개 프로필에서 추론된 인구통계 속성(연령, 국가, 성별, 인종)을 포함시켜 혐오 발언 탐지의 편향을 연구한다.
  • 다언어에 걸친 베이스라인 분류 결과를 제공하고 그룹 기반 지표를 사용하여 형평성을 분석한다.

제안 방법

  • 다섯 개 언어 데이터셋의 혐오 발언 라벨을 병합하고 이진화하여 단일의 다국어 말뭉치를 구성한다.
  • 프로필 이미지(Face++)와 위치 데이터(Google Maps)에서 인구통계 속성을 추론하되, 트윗 내용은 속성 추론에서 제외한다.
  • 일부 프로필 표본에서 크라우드소싱을 통해 인구통계 속성 추론 정확도를 평가한다.
  • 다언어에 걸친 혐오 발언 탐지에서 네 가지 베이스라인 분류기(Logistic Regression, CNN, RNN, BERT)를 평가한다.
  • 인구통계 그룹 간의 진짜/가짜 양성/음성 비율의 등가 차이를 사용해 형평성을 측정한다.

실험 결과

연구 질문

  • RQ1저자 수준의 인구통계 속성이 다언어에 걸친 혐오 발언 탐지 성능에 어떻게 영향을 미치는가?
  • RQ2다국어 혐오 발언 말뭉치에서 인구통계 그룹으로 평가될 때 일반적인 문서 분류기의 형평성 프로파일은 무엇인가?
  • RQ3텍스트에서의 인구통계 속성 예측 가능성은 프로필 기반 특징보다 얼마나 높은가, 그리고 이것이 형평성 분석에 무엇을 시사하는가?

주요 결과

  • 기본 분류기들은 언어별로 성능이 다양하게 나타난다; 신경망 모델(CNN, RNN)이 일반적으로 로지스틱 회귀보다 우수한 반면, BERT는 도메인 일반화 문제로 일부 언어에서 성능이 떨어진다.
  • 연령과 성별은 여러 언어에서 형평성 차이가 더 두드러지며, Polish 및 Italian에서 연령/성별에 대한 편향이 더 강하게 나타난다; 국적 및 인종 관련 편향은 언어별로 다르게 나타난다.
  • 영어 데이터는 속성 전반에 걸쳐 가장 편향이 적은 경향이며, Polish/Italian 데이터셋은 여러 모델에서 연령과 성별에 대해 더 높은 편향을 보인다.
  • 언어 및 모델 간에 전체 분류 성능과 형평성 편향 사이에 강하고 일관된 상관관계는 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.