Skip to main content
QUICK REVIEW

[논문 리뷰] Demographics Should Not Be the Reason of Toxicity: Mitigating Discrimination in Text Classifications with Instance Weighting

Guanhua Zhang, Bing Bai|arXiv (Cornell University)|2020. 04. 29.
Hate Speech and Cyberbullying Detection참고 문헌 32인용 수 5
한 줄 요약

이 논문은 텍스트 분류에서 의도하지 않은 인구통계적 편향을 줄이기 위해 모델에 종속되지 않는 탈편향 프레임워크를 제안한다. 이는 비차별성에서 차별성 분포로의 선택 편향을 모델링함으로써 이루어지며, 사전 정의된 인구통계적 용어를 기반으로 한 인스턴스 가중치를 사용하여 추가 데이터나 주석 없이도 편향 없는 모델 훈련을 복원한다. 이는 세 가지 벤치마크 데이터셋에서 일반화 성능을 유지하면서 공정성 격차를 크게 줄인다.

ABSTRACT

With the recent proliferation of the use of text classifications, researchers have found that there are certain unintended biases in text classification datasets. For example, texts containing some demographic identity-terms (e.g., "gay", "black") are more likely to be abusive in existing abusive language detection datasets. As a result, models trained with these datasets may consider sentences like "She makes me happy to be gay" as abusive simply because of the word "gay." In this paper, we formalize the unintended biases in text classification datasets as a kind of selection bias from the non-discrimination distribution to the discrimination distribution. Based on this formalization, we further propose a model-agnostic debiasing training framework by recovering the non-discrimination distribution using instance weighting, which does not require any extra resources or annotations apart from a pre-defined set of demographic identity-terms. Experiments demonstrate that our method can effectively alleviate the impacts of the unintended biases without significantly hurting models' generalization ability.

연구 동기 및 목표

  • 'Lesbian', 'gay', 'black'와 같은 신원어휘(term)가 독성과 비례적으로 연결되는 텍스트 분류 데이터셋에서 의도하지 않은 인구통계적 편향을 해결하기 위해.
  • 비차별성에서 차별성 분포로의 선택 편향으로서 편향을 수식화하기 위해.
  • 추가적인 데이터 수집이나 주석 없이도 사전 정의된 인구통계적 용어 목록 외에는 추가 자원이 필요 없는 탈편향 방법을 개발하기 위해.
  • 모델의 일반화 성능를 유지하면서 다양한 인구통계적 집단 간의 공정성 격차를 크게 줄이기 위해.
  • NLP에서 편향 완화를 위한 데이터 증강 또는 보완의 실용적이고 확장 가능한 대안을 제공하기 위해.

제안 방법

  • 의도하지 않은 편향을 선택 편향으로 수식화: 비차별성 분포에서 유래한 샘플들이 신원어휘(term)에 따라 독성으로 선택적으로 레이블링된다.
  • 편향된 데이터셋 내 각 샘플이 그 신원 콘텐츠에 따라 비차별성 분포에서 유래할 확률이 있다고 가정한다.
  • 관측된 편향된 데이터와 신원어휘 목록만을 사용하여, 모델이 비차별성 분포를 학습할 수 있도록 인스턴스 가중치를 유도한다.
  • 모델 훈련 중에 이 가중치를 적용하여 비편향 손실을 최소화함으로써, 데이터 분포를 수정하지 않고도 모델을 탈편향한다.
  • 역전파 중에 교차 엔트로피 손실을 재가중하기 위해 가중치를 사용하여, 다양한 아키텍처에 모델에 종속되지 않는 적용이 가능하도록 한다.
  • 세 가지 데이터셋(Jigsaw Toxicity, Toxicity Comments, 및 제3의 데이터셋)에서 방법을 검증하며, 베이스라인 및 데이터 보완 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1추가로 레이블링된 데이터나 주석이 필요 없이 텍스트 분류에서 인구통계적 편향을 완화할 수 있는가?
  • RQ2인스턴스 가중치는 편향된 데이터셋에서 비차별성 분포를 얼마나 효과적으로 복원하는가?
  • RQ3제안된 방법은 공정성 격차를 줄이면서도 모델의 일반화 성능를 유지하는가?
  • RQ4공정성 및 성능 측면에서 데이터 보완 및 증강 기법과 비교해 볼 때 방법의 성능는 어떠한가?
  • RQ5이 방법은 다양한 NLP 작업 및 모델 아키텍처에 일반적으로 적용 가능한가?

주요 결과

  • Jigsaw Toxicity 데이터셋에서 제안된 Weight 방법은 IPTTS AUC 0.852를 기록하여, 베이스라인(0.835)을 능가하고 데이터 보완 방법(0.853)과 유사한 성능를 보였다.
  • Weight 방법은 전체 양성 예측률(FPR)을 0.035로 낮춰, 베이스라인의 0.068에 비해 공정성과 정확도 향상을 나타냈다.
  • 'gay', 'homosexual', 'lesbian'을 포함한 문장들에 대해 Weight 모델은 전체 FPR에 대한 편차(ΔFPR)를 거의 0으로 줄여 공정성 향상을 크게 개선했다.
  • 추가 데이터 수집이나 주석 없이도 데이터 보완 방법보다 유사하거나 우수한 공정성 지표(FPED 및 FNED)를 달성했다.
  • Toxicity Comments 데이터셋에서 Weight 방법은 IPTTS AUC와 FPED에서 베이스라인을 능가했으며, 추가 데이터 없이도 데이터 보완 방법과 동등한 성능를 보였다.
  • 모델의 일반화 성능는 유지되었으며, Orig. AUC 점수는 베이스라인 및 데이터 보완 방법과 유사하여 전체 모델 능력에 유의미한 하락이 없음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.