[논문 리뷰] Unmasking Contextual Stereotypes: Measuring and Mitigating BERT's Gender Bias
본 논문은 BERT의 성별 편향을 영어-독일어 이중 프레임워크로 측정하기 위해 편향 평가 말뭉치(BEC-Pro)와 masked-language-model 접근법을 활용하고, Counterfactual Data Substitution followed by fine-tuning on GAP data로 완화를 평가한다. 또한 독일어를 비롯한 다언어 간 한계가 있음을 보여준다.
Contextualized word embeddings have been replacing standard embeddings as the representational knowledge source of choice in NLP systems. Since a variety of biases have previously been found in standard word embeddings, it is crucial to assess biases encoded in their replacements as well. Focusing on BERT (Devlin et al., 2018), we measure gender bias by studying associations between gender-denoting target words and names of professions in English and German, comparing the findings with real-world workforce statistics. We mitigate bias by fine-tuning BERT on the GAP corpus (Webster et al., 2018), after applying Counterfactual Data Substitution (CDS) (Maudslay et al., 2019). We show that our method of measuring bias is appropriate for languages such as English, but not for languages with a rich morphology and gender-marking, such as German. Our results highlight the importance of investigating bias and mitigation techniques cross-linguistically, especially in view of the current emphasis on large-scale, multilingual language models.
연구 동기 및 목표
- 직업 관련 맥락을 사용하여 영어와 독일어에서 BERT에 성별 편향이 어떻게 내재되어 있는지 평가한다.
- 템플릿 기반 편향 측정 말뭉치(BEC-Pro)를 개발하고 MLM 기반 연관성 지표를 검증한다.
- Counterfactual Data Substitution (CDS)를 적용하고 균형 말뭉치(GAP)로 파인튜닝하여 편향 완화를 평가한다.
- 독일어의 형태소적 특성과 같은 언어적 요인을 강조하며 편향 측정 및 완화 방법의 다언어 간 전이 가능성을 조사한다.
제안 방법
- 현실 세계의 노동력 통계에 고정된 직업 중심 템플릿을 사용해 영어와 독일어로 BEC-Pro를 만든다.
- 속성에 조건을 두고 log-ratio 타깃을 계산하여 BERT의 masked language model (P(T|A) vs P(T))를 사용해 연관 편향을 측정한다.
- GAP 말뭉치에 CDS를 적용하고 영어 BERT를 (three epochs, AdamW)로 파인튜닝하여 편향을 줄인 뒤 재평가한다.
- 측정 템플릿을 독일어로 번역·적응하여 다언어 간 전이를 테스트하고 문법적 성별이 편향 측정에 미치는 영향을 분석한다.
실험 결과
연구 질문
- RQ1MLM 기반 연관 점수를 사용하여 영어와 독일어에서 BERT의 성별 편향을 신뢰성 있게 측정할 수 있는가?
- RQ2이후 파인튜닝과 함께 Counterfactual Data Substitution이 영어 BERT의 편향을 완화하는가, 그리고 그 정도는 어느 정도인가?
- RQ3영어용으로 개발된 측정 방법이 형태소가 풍부하고 성별 표지가 있는 독일어로 전이되는가?
- RQ4측정된 편향이 직업 그룹별 실제 고용 통계와 어떤 관계가 있는가?
주요 결과
- 영어의 경우, CDS + 파인튜닝은 여성 타깃이 여성 전형적 직업과 연관을 줄이지만, 반전형 상황에서는 연관이 증가할 수 있다.
- 파인튜닝 전 영어 BERT의 편향은 실제 고용 통계와 정합되며, 편향 완화 효과는 남성 용어보다 여성 용어에서 더 뚜렷하다.
- 독일어 결과는 독일어의 문법적 성별 표지로 인해 영어 기반 측정 방법의 전이가 미흡함을 보이며, 여성 타깃에 대해 일관되게 더 높은 연관을 보인다.
- 독일어에서는 성별 표지로 인해 남성/여성 직업 용어 간 연관이 다르게 나타나며, 이는 영어 방법이 포착하지 못하는 언어 특이적 편향을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.