Skip to main content
QUICK REVIEW

[논문 리뷰] Quantifying Gender Bias Towards Politicians in Cross-Lingual Language Models

Karolina Stańczak, Sagnik Ray Choudhury|arXiv (Cornell University)|2021. 04. 15.
Gender Politics and Representation인용 수 5
한 줄 요약

이 논문은 다국어 프로빙 방법을 도입하여 다국어 언어 모델의 성별 편향을 측정한다. 7개 언어와 6개 모델에서 정치인 이름 주변의 형용사와 동사를 분석함으로써 이루어지며, 언어 특화된 스테레오타입이 모델 출력을 강하게 형성하는 것으로 나타났다. 예를 들어 '아름다운'과 '이혼한'이라는 단어는 주로 여성 정치인과 연결된다. 그러나 더 큰 모델이 더 높은 편향을 보이진 않는다.

ABSTRACT

Recent research has demonstrated that large pre-trained language models reflect societal biases expressed in natural language. The present paper introduces a simple method for probing language models to conduct a multilingual study of gender bias towards politicians. We quantify the usage of adjectives and verbs generated by language models surrounding the names of politicians as a function of their gender. To this end, we curate a dataset of 250k politicians worldwide, including their names and gender. Our study is conducted in seven languages across six different language modeling architectures. The results demonstrate that pre-trained language models' stance towards politicians varies strongly across analyzed languages. We find that while some words such as dead, and designated are associated with both male and female politicians, a few specific words such as beautiful and divorced are predominantly associated with female politicians. Finally, and contrary to previous findings, our study suggests that larger language models do not tend to be significantly more gender-biased than smaller ones.

연구 동기 및 목표

  • 다양한 언어에서 사전 학습된 언어 모델이 정치인에게 어떻게 성별 편향을 나타내는지 조사하기 위해.
  • 이름이 부여된 실체 주변의 생성 텍스트를 활용해 확장 가능한 다국어 프로빙 방법을 개발하기 위해.
  • 더 큰 언어 모델이 더 뚜렷한 성별 편향을 보이는지 평가하기 위해.
  • 남성, 여성, 비이원성 정치인에 대한 태도를 나타내는 수단으로서 생성 텍스트의 정서와 어휘 연관성을 분석하기 위해.
  • 언어적 및 문화적 다양성이 다국어 모델의 편향 패턴에 어떻게 영향을 미치는지 평가하기 위해.

제안 방법

  • 위키데이터에서 성별 레이블을 확보한 25만 명의 정치인을 포함하는 다국어 데이터셋을 정제함. 다양한 국가와 언어를 포함함.
  • 사전 학습된 다국어 언어 모델을 사용하여 각 정치인의 이름 주변(예: '___ 사람')에서 형용사와 동사를 생성함.
  • 정치인 성별에 따라 생성된 단어의 빈도와 정서를 분석함으로써 성별 편향을 측정하기 위해 잠재변수 모델을 적용함.
  • 7개의 언어 유형이 다른 언어(예: 영어, 독일어, 아랍어, 일본어)에서 6개의 다국어 아키텍처(예: mBERT, XLM-R)를 대상으로 실험 수행함.
  • 점별 상호정보량(PMI)과 정서 점수를 사용하여 스테레오타입 연관성을 정량화함.
  • 비이원성 정체성에 대한 데이터 부족으로 인해 이진 성별 정치인에 국한하여 분석을 수행함. 다만, 이 방법은 확장 가능함.

실험 결과

연구 질문

  • RQ1다국어 언어 모델의 성별 편향은 다양한 언어에서 어떻게 달라지나?
  • RQ2다국어 모델 출력에서 특정 단어들이 남성 정치인과 여성 정치인 중 어느 쪽과 주로 연관되는가?
  • RQ3모델 크기와 성별 편향 증가 사이에 상관관계가 있는가?
  • RQ4여러 언어에서 남성 정치인과 여성 정치인에 대해 생성된 텍스트에서 일관된 정서 패턴(긍정, 부정, 중립)이 존재하는가?
  • RQ5문화적 및 언어적 차이가 언어 모델의 성별 편향 표현에 어떻게 영향을 미치는가?

주요 결과

  • 언어가 모델의 태도에 크게 영향을 미침: 영어 모델은 남성 정치인과 부정적 정서를 연관시키지만, 대부분의 다른 언어는 반대 패턴을 보임.
  • '아름다운', '이혼한', '모성의'와 같은 단어들이 여러 언어에서 여성 정치인과 주로 연관됨.
  • 남성 정치인은 '사망한', '지명된' 등의 단어와 연관되며, 이 단어들은 여성 정치인과도 함께 사용되는 경우가 있어 일부 성별을 초월한 사용 패턴을 보임.
  • 이전 연구 결과와는 달리, 더 큰 언어 모델이 더 높은 성별 편향을 보이진 않음.
  • 비이원성 정치인은 데이터셋의 0.025%에 불과하여 분석에 제한이 있으며, 데이터 부족이 핵심 제한 요소로 드러남.
  • 본 연구는 언어 모델이 정치 담론에서 기존의 사회적 및 미디어 편향을 반영하고 강화하고 있음을 드러내며, 특히 다국어 환경에서 그러한 경향이 두드러짐.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.