Skip to main content
QUICK REVIEW

[논문 리뷰] The Woman Worked as a Babysitter: On Biases in Language Generation

Emily Sheng, Kai-Wei Chang|arXiv (Cornell University)|2019. 09. 03.
Topic Modeling참고 문헌 13인용 수 10
한 줄 요약

이 논문은 자연어 생성(NLG)에서 편향을 더 정확하게 측정하기 위해 감정 점수보다 더 나은 대체 지표로 'regard'(사회적 인식)라는 지표를 도입한다. 인간이 애너테이션한 데이터와 미세튜닝된 BERT 분류기를 사용하여, GPT-2와 같은 언어 모델이 흑인, 여성, 게이 개인을 부정적인 역할이나 특성과 연결하는 심각한 편향을 보임을 입증한다. 이는 감정 분석이 이러한 편향을 감지하지 못하는 경우가 있음을 시사한다.

ABSTRACT

We present a systematic study of biases in natural language generation (NLG) by analyzing text generated from prompts that contain mentions of different demographic groups. In this work, we introduce the notion of the regard towards a demographic, use the varying levels of regard towards different demographics as a defining metric for bias in NLG, and analyze the extent to which sentiment scores are a relevant proxy metric for regard. To this end, we collect strategically-generated text from language models and manually annotate the text with both sentiment and regard scores. Additionally, we build an automatic regard classifier through transfer learning, so that we can analyze biases in unseen text. Together, these methods reveal the extent of the biased nature of language model generations. Our analysis provides a study of biases in NLG, bias metrics and correlated human judgments, and empirical evidence on the usefulness of our annotated dataset.

연구 동기 및 목표

  • 열린 도메인 자연어 생성(NLG)에서 다양한 인구집단에 대해 편향을 체계적으로 조사하기 위해.
  • 감정 점수가 NLG에서 편향을 측정하는 지표로 사용될 때, 특히 미묘한 사회적 함의를 포착하지 못하는 한계를 규명하기 위해.
  • 'regard'(인구집단에 대한 사회적 인식을 측정하는 지표)를 제안하고 검증하여 더 정확한 편향 지표로 활용하기 위해.
  • 기준으로 사용할 수 있도록 인간 애너테이션된 NLG 출력 데이터셋을 구축하고 공개하기 위해.
  • 전이 학습 기반의 자동 regard 분류기를 개발하여 미리 보지 못한 텍스트에서 편향 탐지를 스케일링하기 위해.

제안 방법

  • 성별, 인종, 성적 지향을 중심으로 한 프롬프트를 사용하여 GPT-2와 LM 1B로부터 텍스트 생성을 수집한다.
  • 302개 샘플을 인간이 애너테이션하여 regard(긍정/중립/부정) 및 감정 점수를 확보하여 골드 스탠다드 데이터셋을 구축한다.
  • 애너테이션된 데이터를 기반으로 BERT 기반 분류기를 훈련시어 자동으로 regard 점수를 예측한다.
  • 다양한 인구집단 쌍 간의 regard 점수와 감정 점수를 비교하여 편향 격차를 평가한다.
  • 편향의 두 가지 맥락(직업 역할 및 사회적 존중 수사어)에서 모델 출력을 분석한다.
  • 통계적 분석을 통해 다양한 인구집단과 모델 유형(GPT-2 대비 LM 1B) 간 regard 격차를 비교한다.

실험 결과

연구 질문

  • RQ1언어 모델이 다양한 인구집단에 대해 불균형한 regard을 얼마나 많이 생성하는가?
  • RQ2NLG 출력을 평가할 때 감정 점수와 인간의 편향 판단 간 상관관계는 어느 정도인가?
  • RQ3사회적 인식으로 정의되는 'regard'가 감정 점수보다 NLG에서 편향을 더 신뢰할 만한 지표로 기능할 수 있는가?
  • RQ4GPT-2와 LM 1B와 같은 다른 언어 모델은 인구집단에 따라 regard 점수에서 어떻게 다를까?
  • RQ5인간이 애너테이션한 regard 레이블을 기반으로 훈련된 자동 분류기가 새로운 NLG 출력에 일반화할 수 있는가?

주요 결과

  • GPT-2는 흑인, 여성, 게이 개인에 대해 백인, 남성, 이성애자 개인보다 유의미하게 더 부정적인 regard을 생성한다. 특히 직업 및 존중 수사어 맥락에서 그러한 경향이 두드러진다.
  • 감정 분석은 사회적 함의가 부정적이지만 극성( polarity )은 중립인 경우에 편향을 감지하지 못한다. 예를 들어 '프로스트를 한 일꾼'은 중립으로 평가되지만 부정적인 사회적 함의를 내포하고 있다.
  • regard 지표는 감정 점수보다 더 큰 편향 격차를 드러내며, 감정 점수만으로는 NLG에서 진정한 편향의 정도를 과소평가하고 있음을 시사한다.
  • BERT 기반 regard 분류기는 존중 및 직업 맥락에서 78–79%의 정확도를 기록하여 자동화된 편향 탐지의 가능성을 입증한다.
  • LM 1B가 생성한 텍스트는 GPT-2에 비해 훨씬 적은 편향을 보이며, 이는 모델 아키텍처와 훈련 데이터가 편향 전파에 중대한 영향을 미친다는 것을 시사한다.
  • GPT-2와 LM 1B 양쪽 모두에서 부정적인 regard 격차가 긍정적인 것보다 더 크며, 이는 편향된 집단이 NLG 출력에서 체계적으로 불리한 위치에 있음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.