[論文レビュー] How True is GPT-2? An Empirical Analysis of Intersectional Occupational Biases.
この論文は、GPT-2の職業的バイアスを、性別と宗教、性的指向、人種、政治的帰属、名前のルーツを組み合わせて、39万6千件の文完成を用いて実証的に分析している。GPT-2は、特に交差的アイデンティティにおいて、女性に対してよりステレオタイプ的で多様性のない職業的関連付けを生成しており、保護される属性間で顕著な相互作用効果を示しており、言語モデルが学習すべきものについての規範的問いを提起している。
The capabilities of natural language models trained on large-scale data have increased immensely over the past few years. Downstream applications are at risk of inheriting biases contained in these models, with potential negative consequences especially for marginalized groups. In this paper, we analyze the occupational biases of a popular generative language model, GPT-2, intersecting gender with five protected categories: religion, sexuality, ethnicity, political affiliation, and name origin. Using a novel data collection pipeline we collect 396k sentence completions of GPT-2 and find: (i) The machine-predicted jobs are less diverse and more stereotypical for women than for men, especially for intersections; (ii) Fitting 262 logistic models shows intersectional interactions to be highly relevant for occupational associations; (iii) For a given job, GPT-2 reflects the societal skew of gender and ethnicity in the US, and in some cases, pulls the distribution towards gender parity, raising the normative question of what language models _should_ learn.
研究の動機と目的
- GPT-2が、性別、宗教、性的指向、人種、政治的帰属、名前のルーツを含む交差的アイデンティティと職業をどのように関連付けるかを調査すること。
- モデルが社会的な職業的ステレオタイプを強化するか緩和するかを評価すること、特にマイノリティグループに対して。
- 交差的相互作用がGPT-2の職業的予測にどの程度影響を与えるかを評価すること。
提案手法
- 交差的アイデンティティを埋め込んだプロンプトを用いて、GPT-2から39万6千件の文完成を生成する、新しいデータ収集パイプラインを構築した。
- モデルは、『彼女は[職業]です』のような、被験者のアイデンティティが交差的属性によって定義されたフレーズをプロンプトとして受け取った。
- 保護される属性の個別的および相互作用的影響を測定するために、262の異なる職業カテゴリでロジスティック回帰モデルを適合した。
- GPT-2の予測された職業分布と米国の現実の職業人口統計を比較し、一致度と乖離度を評価した。
- 交差的バイアスは、ロジスティックモデルにおける相互作用項の有意性と方向性を評価することで測定した。
実験結果
リサーチクエスチョン
- RQ1性別を他の保護されるカテゴリと組み合わせた場合、GPT-2の予測職業は男性と女性でどのように異なるか?
- RQ2交差的相互作用(例:女性+ムスリム+ブラック)が、GPT-2の職業的予測にどの程度顕著に影響を与えるか?
- RQ3GPT-2の職業的分布は、現実の米国の性別および人種的職業代表割合にどの程度近いか?
- RQ4GPT-2の出力は、特定の職業で性別均等に向かって傾いているか。もしそうなら、どのような条件下か?
- RQ5言語モデルが歪んだまたは均等性指向の職業的関連付けを学習することは、どのような規範的含みを有するか?
主な発見
- GPT-2は、特に交差的アイデンティティにおいて、男性よりも女性に対して顕著に多様性が低く、ステレオタイプ的である職業的関連付けを生成している。
- 性別と宗教や人種の組み合わせといった、交差的相互作用は、職業的予測を形作る上で顕著に有意であった。これは、非加法的バイアス効果を示している。
- 多くの職業について、GPT-2の予測された性別分布は、現実の米国の職業人口統計と一致しており、社会的歪みを反映している。
- 一部のケースでは、GPT-2の予測が性別均等に向かって引き寄せられ、モデルの行動が常に現実の差異を反映しているわけではないことが示された。
- モデルの行動は、言語モデルが既存の不平等を反映すべきか、それとも職業的関連付けにおける公平性を追求すべきかという、規範的懸念を喚起している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。