Skip to main content
QUICK REVIEW

[논문 리뷰] Examining Racial Bias in an Online Abuse Corpus with Structural Topic Modeling

Thomas Davidson, Debasmita Bhattacharya|arXiv (Cornell University)|2020. 05. 26.
Computational and Text Analysis Methods참고 문헌 18인용 수 11
한 줄 요약

이 논문은 구조적 토픽 모델링(STM)을 사용하여 예측된 아프리카계 미국인 영어(AAE) 사용을 공변량으로 포함시켜 소셜미디어 폭력 데이터셋 내 인종적 편향을 탐지한다. 연구 결과, AAE와 강하게 연관된 한 토픽이 폭력적 주석과 비례적으로 더 많이 연결되어 있음을 확인하였으며, 이는 혐오 발언 탐지 데이터셋에서 핵심적인 편향 원인임을 드러낸다.

ABSTRACT

We use structural topic modeling to examine racial bias in data collected to train models to detect hate speech and abusive language in social media posts. We augment the abusive language dataset by adding an additional feature indicating the predicted probability of the tweet being written in African-American English. We then use structural topic modeling to examine the content of the tweets and how the prevalence of different topics is related to both abusiveness annotation and dialect prediction. We find that certain topics are disproportionately racialized and considered abusive. We discuss how topic modeling may be a useful approach for identifying bias in annotated data.

연구 동기 및 목표

  • 혐오 발언 탐지에 사용되는 주석 처리된 소셜미디어 데이터셋 내 인종적 편향을 조사하기 위해.
  • 아프리카계 미국인 영어(AAE) 사용이 폭력적 언어 주석과 관련이 있는지 조사하기 위해.
  • 구조적 토픽 모델링(STM)을 사용해 잠재 토픽과 동시에 폭력성 및 AAE와의 연관성을 밝혀내기 위해.
  • AAE와 관련된 언어 패턴이 자동 폭력 탐지에서 잘못된 양성 결과를 유도할 수 있는지 규명하기 위해.
  • 토픽 모델링이 주석 처리된 NLP 데이터셋 내 숨겨진 편향을 폭 드러낼 수 있음을 보여주기 위해.

제안 방법

  • 각 트윗이 아프리카계 미국인 영어(AAE)로 작성되었을 확률을 예측하기 위해 사전에 훈련된 언어 모델을 적용하였다.
  • 폭력성 주석과 AAE 확률을 공변량으로 사용하여 주제 빈도를 모델링하기 위해 구조적 토픽 모델링(STM)을 사용하였다.
  • URL, 멘션,标 punctuations, 숫자, 불용어를 제거하고, 최소 5개 이상의 트윗에 등장하는 단어들만 유지하여 트윗을 전처리하였다.
  • 중복 트윗을 제거하고 희귀어만 포함된 문서를 제거하여 최종적으로 75,023개의 트윗으로 구성된 샘플을 확보하였다.
  • 모델 적합도와 해석 가능성의 균형을 위해 정량적 진단과 정성적 검토를 통해 K=30개의 주제를 선정하였다.
  • 주제 비율이 AAE 확률 및 폭력성 주석과의 관계를 모델링하기 위해 estimateEffect 함수를 사용하여 주제 비율을 추정하였다.

실험 결과

연구 질문

  • RQ1폭력적 언어 데이터셋 내 특정 주제가 아프리카계 미국인 영어(AAE) 사용과 비례적으로 더 많이 연관되어 있는가?
  • RQ2폭력적 주석이 부여된 트윗과 정상으로 표시된 트윗 간 특정 주제의 빈도는 어떻게 달라지는가?
  • RQ3폭력적 트윗에서 AAE 확률과 주제 빈도 사이에 유의미한 상호작용이 존재하는가?
  • RQ4구조적 토픽 모델링이 주석 처리된 혐오 발언 데이터셋 내 숨겨진 편향을 드러낼 수 있는가?
  • RQ5AAE와 관련된 주제가 폭력적 주석과 더 강하게 연관되어 있는가? 이는 잠재적인 잘못된 양성 결과를 시사하는가?

주요 결과

  • 주제 4는 AAE 확률과 주제 빈도 사이에 강한 양의 상관관계를 보이며, 특히 폭력적 트윗에서 AAE 확률이 80%일 경우 주제 비율이 50%를 초과함을 나타낸다.
  • 주제 20는 폭력적 트윗에서 AAE 확률과 주제 빈도 사이에 부정적 상관관계를 보이며, AAE 가능성 증가에 따라 주제 사용 빈도가 낮아지는 경향을 보인다.
  • 대부분의 주제(30개 중 28개)는 주제 빈도와 AAE 확률 사이에 약하거나 무시할 수 있는 상관관계를 보이며, 대부분의 콘텐츠가 인종적 편향이 아님을 시사한다.
  • 주제 12와 24는 주석 여부에 관계없이 AAE 확률과 주제 비율 사이에 거의 평탄한 관계를 보이며, 폭력성과의 관련성이 낮음을 나타낸다.
  • 결과적으로, AAE와 폭력적 주석 양쪽과 강하게 연관된 주제가 오직 두 개(4번과 20번)에 불과하며, 이는 데이터셋 내 특정한 편향 원인을 드러낸다.
  • 이 연구는 공변량을 포함한 토픽 모델링이 주석 처리된 텍스트 데이터 내 숨겨진 구조적 편향, 특히 인종과 방언과의 관련성에서 드러낼 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.