Skip to main content
QUICK REVIEW

[論文レビュー] Towards Understanding Gender-Seniority Compound Bias in Natural Language Generation

Samhita Honnavalli, Aesha Parekh|arXiv (Cornell University)|May 19, 2022
Text Readability and Simplification被引用数 7
ひとこと要約

本論文は、米国上院および教授職の分野から得た遠隔教師ありデータセットを用いて、自然言語生成における複合的性別・役職バイアスを研究するための新規フレームワークを提示する。GPT-2は、女性をより頻繁に若手職に、男性をより頻繁に上位職に結びつけることでバイアスを強化しており、若手教授のプロンプトでは男性性別言語が8.3%増加し、真の値と比較して女性のアシスタント准教授の割合を18.5% overestimateしていることが示された。

ABSTRACT

Women are often perceived as junior to their male counterparts, even within the same job titles. While there has been significant progress in the evaluation of gender bias in natural language processing (NLP), existing studies seldom investigate how biases toward gender groups change when compounded with other societal biases. In this work, we investigate how seniority impacts the degree of gender bias exhibited in pretrained neural generation models by introducing a novel framework for probing compound bias. We contribute a benchmark robustness-testing dataset spanning two domains, U.S. senatorship and professorship, created using a distant-supervision method. Our dataset includes human-written text with underlying ground truth and paired counterfactuals. We then examine GPT-2 perplexity and the frequency of gendered language in generated text. Our results show that GPT-2 amplifies bias by considering women as junior and men as senior more often than the ground truth in both domains. These results suggest that NLP applications built using GPT-2 may harm women in professional capacities.

研究の動機と目的

  • 事前学習済み言語モデル(GPT-2など)における役職が性別バイアスにどのように影響するかを調査すること。
  • NLP研究において性別バイアスを独立して研究する傾向があるが、本研究は、交差的で社会的なバイアスを考慮しないというギャップを埋めること。
  • 自然言語生成における複合バイアスを評価するための堅牢なベンチマークデータセットを開発すること。
  • 役職がNLGモデルにおける既存の性別バイアスを顕著に強化することを実証すること、特に職業的役割の記述において顕著である。

提案手法

  • 米国の上院議員およびコンピュータサイエンスの教授の分野から、Google検索結果と人間による検証済み真値を用いて、遠隔教師ありデータセットを構築した。
  • 元の人の書いたテキストサンプルの性別および役職ラベルを入れ替えることで、ペairedな反事実的文を生成した。
  • GPT-2を用いて、異なる役職(若手/上位)および性別(男性/女性)ラベルを含むプロンプトからテキストを生成した。
  • 生成出力における周辺度と性別言語の頻度を測定することでバイアスを評価した。
  • AMTベースの人的評価を実施し、生成されたテキストにおける性別言語を分類し、真値分布と比較した。
  • 2標本z検定を用いて、真値と観測された性別言語頻度の差の有意性を評価した。

実験結果

リサーチクエスチョン

  • RQ1役職がGPT-2のテキスト生成における性別バイアスの度合いにどのように影響するか?
  • RQ2GPT-2は、女性を若手職に、男性を上位職に多く結びつけることで、表現バイアスをどの程度強化するか?
  • RQ3性別と役職の複合バイアスは、学術的および政治的分野における昇進バイアスを増大させるか?
  • RQ4役職を明示すること(例:「若手上院議員」対「上院議員」)は、モデルの性別言語出力にどのように影響するか?
  • RQ5遠隔教師ありデータセットは、NLGモデルにおける複合的性別・役職バイアスを効果的に捉え、ベンチマーク化できるか?

主な発見

  • 『上位上院議員』とプロンプトされた場合、GPT-2は真値と比較して男性性別言語の割合を8.3% overestimateしている。
  • アシスタント准教授のプロンプトでは、GPT-2は真値と比較して女性性別言語を18.5%多く生成しており、昇進バイアスの強化が示唆される。
  • 『若手上院議員』とプロンプトされた場合、GPT-2は役職が明示されていない場合と比較して、女性性別言語を7%多く生成している。
  • 『上位上院議員』とプロンプトされた場合、GPT-2は女性性別言語を1.4%減少させ、男性性別言語を1.4%増加させている(中立的プロンプトと比較)。
  • 教授職分野では、GPT-2は真値と比較して、女性のアシスタント准教授の割合を18.5%、准教授の割合を11.5% overestimateしている。
  • 統計的有意性検定の結果、すべてのケースで観測された性別言語の差が有意(p < 0.05)であることが確認されたが、男性上位上院議員および男性若手上院議員のケースを除く。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。