Skip to main content
QUICK REVIEW

[논문 리뷰] How True is GPT-2? An Empirical Analysis of Intersectional Occupational Biases.

Hannah Rose Kirk, Yennie Jun|arXiv (Cornell University)|2021. 02. 08.
Computational and Text Analysis Methods참고 문헌 2인용 수 5
한 줄 요약

이 논문은 GPT-2의 직업적 편향을 성별과 종교, 성적 지향, 민족, 정치적 소속, 이름 기원을 교차시켜 경험적으로 분석한다. 396,000개의 문장 완성문을 사용하여, GPT-2는 여성에 대해 더 전형적이고 다양성이 떨어지는 직업 연관성을 생성하며, 특히 교차 정체성에서 그러한 경향이 두드러진다. 또한 보호받는 범주 간에 상당한 상호작용 효과를 드러내어 언어 모델이 무엇을 학습해야 할지에 대한 규범적 질문을 제기한다.

ABSTRACT

The capabilities of natural language models trained on large-scale data have increased immensely over the past few years. Downstream applications are at risk of inheriting biases contained in these models, with potential negative consequences especially for marginalized groups. In this paper, we analyze the occupational biases of a popular generative language model, GPT-2, intersecting gender with five protected categories: religion, sexuality, ethnicity, political affiliation, and name origin. Using a novel data collection pipeline we collect 396k sentence completions of GPT-2 and find: (i) The machine-predicted jobs are less diverse and more stereotypical for women than for men, especially for intersections; (ii) Fitting 262 logistic models shows intersectional interactions to be highly relevant for occupational associations; (iii) For a given job, GPT-2 reflects the societal skew of gender and ethnicity in the US, and in some cases, pulls the distribution towards gender parity, raising the normative question of what language models _should_ learn.

연구 동기 및 목표

  • GPT-2가 성별, 종교, 성적 지향, 민족, 정치적 소속 및 이름 기원을 포함한 교차 정체성과 어떻게 직업을 연관시키는지 조사하기.
  • 모델가 사회적 직업 편견을 강화하거나 완화하는지 평가하기, 특히 소외된 집단에 대해.
  • 교차 정체성의 상호작용이 GPT-2의 직업 예측에 얼마나 영향을 미치는지 평가하기.

제안 방법

  • 새로운 데이터 수집 파이프라인을 통해 GPT-2에 교차 정체성을 통합한 프롬프트를 사용해 396,000개의 문장 완성문을 생성하였다.
  • 모델은 '그녀는 [직업]이다'와 같은 정체성이 통합된 어조를 사용하여 프롬프트를 제공받았다. 여기서 주체의 정체성은 다중 정체성적 특성으로 정의되었다.
  • 보호받는 특성의 개별적 영향과 상호작용 효과를 정량화하기 위해 262개의 고유한 직업 범주에 대해 로지스틱 회귀 모델을 적합시켰다.
  • 실제 미국 직업 인구 통계와의 일치도 및 이질성을 평가하기 위해 GPT-2의 예측 직업 분포를 실질적인 미국 직업 인구 구조와 비교하였다.
  • 교차 편향은 로지스틱 모델의 상호작용 항목의 유의성과 방향성을 평가하여 측정되었다.

실험 결과

연구 질문

  • RQ1남성과 여성 간에 다른 정체성과 교차시켰을 때, GPT-2의 예측 직업은 어떻게 다를까?
  • RQ2성별과 종교 또는 민족의 교차 상호작용(예: 여성 + 무슬림 + 흑인)이 GPT-2의 직업 예측에 얼마나 유의미하게 영향을 미치는가?
  • RQ3GPT-2의 직업 분포는 실제 미국의 성별 및 민족적 직업 구성과 얼마나 유사한가?
  • RQ4GPT-2의 출력이 어떤 조건에서 특정 직업에서 성별 평등성에 수렴하는가? 만약 그렇다면 어떤 조건에서 그런가?
  • RQ5언어 모델이 비대칭적이거나 평등성 중심의 직업 연관성을 학습하는 것이 규범적으로 어떤 함의를 지닌다?

주요 결과

  • GPT-2는 여성에 대해 남성보다 훨씬 더 전형적이며 다양성이 떨어지는 직업 연관성을 생성하며, 특히 교차 정체성에서 그러한 경향이 두드러진다.
  • 성별과 종교 또는 민족의 교차 상호작용은 직업 예측을 형성하는 데 매우 유의미한 것으로 나타나 비가산적 편향 효과를 시사한다.
  • 많은 직업에서 GPT-2의 예측 성별 분포는 실제 미국 직업 인구 통계와 일치하며 사회적 편향을 반영한다.
  • 어떤 경우에는 GPT-2의 예측이 성별 평등성 쪽으로 수렴하는 경향을 보여, 모델의 행동이 항상 실질적인 격차를 반영하는 것은 아님을 시사한다.
  • 모델의 행동은 언어 모델이 기존의 불평등을 반영해야 할지, 아니면 직업 연관성에서 공정성을 추구해야 할지에 대한 규범적 우려를 제기한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.