[논문 리뷰] Intersectional Bias in Hate Speech and Abusive Language Datasets
이 연구는 공개된 트위터 데이터셋에서 99,996개의 트윗을 분석하여 혐오 발언 및 폭력적 언어 데이터셋에서 인종, 성별, 정치적 소속이 교차하는 방식으로 발생하는 편향을 조사한다. 아프리카계 미국인 트윗—특히 아프리카계 미국인 남성들—은 다른 집단에 비해 폭력적 또는 혐오스럽다고 더 높은 확률로 분류되었으며, 정치적 소속을 통제한 후에도 폭력적 분류 가능성은 최대 3.7배 높고 혐오스러운 분류 가능성은 77% 높았다. 이는 이러한 데이터셋에서 교차 편향에 대한 체계적인 증거를 제공한다.
Algorithms are widely applied to detect hate speech and abusive language in social media. We investigated whether the human-annotated data used to train these algorithms are biased. We utilized a publicly available annotated Twitter dataset (Founta et al. 2018) and classified the racial, gender, and party identification dimensions of 99,996 tweets. The results showed that African American tweets were up to 3.7 times more likely to be labeled as abusive, and African American male tweets were up to 77% more likely to be labeled as hateful compared to the others. These patterns were statistically significant and robust even when party identification was added as a control variable. This study provides the first systematic evidence on intersectional bias in datasets of hate speech and abusive language.
연구 동기 및 목표
- 혐오 발언 및 폭력적 언어 데이터셋이 인종, 성별, 정치적 소속과 같은 상호작용하는 사회적 정체성 측면에서 편향을 보이는지 조사하기 위해.
- 다른 디모그래픽 집단에 비해 아프리카계 미국인 트윗이 폭력적 또는 혐오스럽다고 비율이 높게 분류되는지 확인하기 위해.
- 정치적 소속 정체성을 통제한 후에도 이러한 편향이 지속되는지 평가하기 위해.
- 널리 사용되는 NLP 데이터셋에서 혐오 발언 탐지에 대해 교차 편향의 체계적 실증적 증거를 제공하기 위해.
제안 방법
- 연구는 Founta 등(2018)이 발표한 공개된 트위터 데이터셋(99,996개의 인간 레이블링 트윗 포함)을 분석하였다.
- 각 트윗에 대해 언어적 신호와 맥락 분석을 조합하여 인종, 성별, 정당 소속 정체성을 분류하였다.
- 디모그래픽 정체성과 레이블링 결과(폭력적, 혐오스럽다) 간의 연관성을 테스트하기 위해 통계 모델링을 적용하였다.
- 다변량 회귀 모델을 사용하여 정당 소속을 통제하고, 레이블링 결과에 대한 인종과 성별의 영향을 분리하였다.
- 모델 사양이나 데이터 불균형으로 인한 결과의 오염 여부를 확인하기 위해 강건성 검증을 실시하였다.
- 다양한 교차 정체성 범주에서 통계적 유의성과 효과 크기를 평가하였다.
실험 결과
연구 질문
- RQ1혐오 발언 데이터셋에서 아프리카계 미국인 트윗은 다른 인종 집단에 비해 폭력적 또는 혐오스럽다고 더 자주 분류되는가?
- RQ2흑인 남성이라는 정체성이 다른 디모그래픽 집단에 비해 혐오스럽다고 분류될 가능성을 높이는가?
- RQ3정치적 소속 소속을 통제한 후에도 레이블링 결과의 편향이 견고한가?
- RQ4어느 정도의 교차 정체성(인종, 성별, 정당)이 애너테이션 결과의 격차에 기여하는가?
주요 결과
- 아프리카계 미국인 트윗은 다른 인종 집단의 트윗에 비해 폭력적이라고 분류될 가능성이 최대 3.7배 높았다.
- 아프리카계 미국인 남성 트윗은 다른 디모그래픽 집단에 비해 혐오스럽다고 분류될 가능성이 최대 77% 높았다.
- 정치적 소속 정체성을 통제한 후에도 이러한 격차는 통계적으로 유의미했다.
- 편향은 다양한 디모그래픽 교차 영역에서 일관되게 나타나, 애너테이션 결과에 체계적인 왜곡이 있음을 시사했다.
- 이 연구는 혐오 발언 및 폭력적 언어 데이터셋에서 교차 편향에 대한 첫 번째 체계적 증거를 제공한다.
- 연구 결과는 NLP 모델의 학습 데이터가 자동 콘텐츠 모니터링에서 사회적 불평등을 유지하거나 악화시킬 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.