Skip to main content
QUICK REVIEW

[論文レビュー] The Woman Worked as a Babysitter: On Biases in Language Generation

Emily Sheng, Kai-Wei Chang|arXiv (Cornell University)|Sep 3, 2019
Topic Modeling参考文献 13被引用数 10
ひとこと要約

この論文は、感情スコアよりもバイアスをより正確に測るための代替指標として、『regard』—特定の人口統計的グループに対する社会的認識を測る指標—を導入する。人間によるアノテーションデータと微調整された BERT クラスファイアを用いて、GPT-2 などの言語モデルが、黒人、女性、ゲイの個人に対して、感情分析では検出できないにもかかわらず、否定的な役割や特徴と関連づける顕著なバイアスを示すことを実証した。

ABSTRACT

We present a systematic study of biases in natural language generation (NLG) by analyzing text generated from prompts that contain mentions of different demographic groups. In this work, we introduce the notion of the regard towards a demographic, use the varying levels of regard towards different demographics as a defining metric for bias in NLG, and analyze the extent to which sentiment scores are a relevant proxy metric for regard. To this end, we collect strategically-generated text from language models and manually annotate the text with both sentiment and regard scores. Additionally, we build an automatic regard classifier through transfer learning, so that we can analyze biases in unseen text. Together, these methods reveal the extent of the biased nature of language model generations. Our analysis provides a study of biases in NLG, bias metrics and correlated human judgments, and empirical evidence on the usefulness of our annotated dataset.

研究の動機と目的

  • オープンドメイン自然言語生成(NLG)における人口統計的グループごとのバイアスを体系的に調査すること。
  • 感情スコアが NLG におけるバイアスの代理指標としての限界、特に微細な社会的含みを捉えることの難しさを特定すること。
  • 社会的認識を測る指標としての『regard』を提案・検証し、バイアスのより正確な指標とする。
  • ベンチマーク用に、regard スコアと感情スコアを併記した人間アノテーション済み NLG 出力データセットを構築・公開すること。
  • 転移学習に基づく自動 regard クラスファイアを開発し、未観測の NLG 出力におけるバイアス検出をスケーリングすること。

提案手法

  • 性別、人種、性的指向に焦点を当てたプロンプトを用いて、GPT-2 および LM 1B からテキスト生成を収集する。
  • 302 個のサンプルを人間が regard(肯定的/中立的/否定的)と感情スコアでアノテートし、ゴールドスタンダードデータセットを構築する。
  • アノテート済みデータを用いて BERT ベースのクラスファイアを訓練し、regard スコアを自動的に予測する。
  • 異なる人口統計的グループ間で regard スコアと感情スコアを比較し、バイアスの格差を評価する。
  • 職業的役割と社会的敬意の表現という2つのバイアス文脈において、モデル出力を分析する。
  • 統計的分析を用いて、人口統計的グループおよびモデルタイプ(GPT-2 対 LM 1B)ごとの regard ギャップを比較する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、異なる人口統計的グループに対して、不均等な regard を生成する程度はどの程度か?
  • RQ2NLG 出力のバイアスを評価する際、感情スコアは人間のバイアス判断とどの程度相関するか?
  • RQ3社会的認識(特定の人口統計的グループに対する)として定義される 'regard' は、感情スコアよりも NLG におけるバイアスのより信頼できる代理指標として機能できるか?
  • RQ4GPT-2 と LM 1B などの異なる言語モデルは、人口統計的グループごとに regard スコアでどのように異なるか?
  • RQ5人間によるアノテーション済み regard ラベルで訓練された自動クラスファイアは、未観測の NLG 出力にどの程度一般化可能か?

主な発見

  • GPT-2 は、職業的文脈および敬意の文脈において、白人・男性・ヘテロセクシュアルの人々と比較して、黒人・女性・ゲイの人々に対して顕著に否定的な regard を生成する。
  • 感情分析は、ポジティブでもネガティブでもないが、社会的含みが否定的であるケース(例:「売買春婦として働いた」)ではバイアスを検出できない。
  • regard 指標は感情スコアよりも大きなバイアスギャップを明らかにし、感情スコアだけでは NLG における真のバイアスの程度を低く見積もっていることが示された。
  • BERT ベースの regard クラスファイアは、敬意および職業的文脈で 78–79% の正確性を達成し、自動バイアス検出の可能性を示した。
  • LM 1B が生成するテキストは GPT-2 よりもバイアスが少ないことが示され、モデルアーキテクチャおよび学習データがバイアスの伝搬に顕著に影響することがわかった。
  • GPT-2 と LM 1B の両方において、否定的 regard ギャップが肯定的ギャップよりも大きいことが確認され、NLG 出力においてマイノリティグループが体系的に不利な立場に置かれていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。