[論文レビュー] Stereotype and Skew: Quantifying Gender Bias in Pre-trained and Fine-tuned Language Models
本稿では、事前学習済みおよび微調整済み言語モデルにおける性別バイアスを定量化するための2つの新しい指標、歪み(skew)とステレオタイプ(stereotype)を導入する。特にWinoBiasの代名詞解決タスクにおいて、歪み(全体的な男性代名詞への傾向)とステレオタイプ(性別化された職業への関連付け)の間にトレードオフが存在することが判明した。また、微調整時のデータ拡張が両方のバイアスを効果的に低減する一方、オンラインバイアス低減手法は一方を軽減するが他方を増大させる傾向にあることが示された。
This paper proposes two intuitive metrics, skew and stereotype, that quantify and analyse the gender bias present in contextual language models when tackling the WinoBias pronoun resolution task. We find evidence that gender stereotype correlates approximately negatively with gender skew in out-of-the-box models, suggesting that there is a trade-off between these two forms of bias. We investigate two methods to mitigate bias. The first approach is an online method which is effective at removing skew at the expense of stereotype. The second, inspired by previous work on ELMo, involves the fine-tuning of BERT using an augmented gender-balanced dataset. We show that this reduces both skew and stereotype relative to its unaugmented fine-tuned counterpart. However, we find that existing gender bias benchmarks do not fully probe professional bias as pronoun resolution may be obfuscated by cross-correlations from other manifestations of gender prejudice. Our code is available online, at https://github.com/12kleingordon34/NLP_masters_project.
研究の動機と目的
- 従来の代名詞・ステレオタイプ関連にとどまらない、文脈依存言語モデルにおける性別バイアスのより細分化された指標の開発を目的とする。
- WinoBiasのような既存のベンチマークが職業に関する性別バイアスを完全に捉えているのか、それとも他のステレオタイプによって混同されているのかを調査すること。
- オンライン歪み低減と微調整時のデータ拡張という2つのバイアス低減戦略の有効性を評価・比較すること。
- 現在のベンチマークが職業以外の特性(能力、性格など)に起因するバイアスを分離できていないため、モデルが非職業的特徴を通じて依然としてバイアスを示す可能性があることを明らかにすること。
- NLPモデルにおける性別偏見の異なる形態をよりよく探査できるよう、より包括的かつ独立したバイアスベンチマークの導入を提言すること。
提案手法
- 歪み(全体的な男性代名詞への好まれる傾向)とステレオタイプ(性別化された職業への代名詞の不均衡な割り当て)という2つの新しいバイアス指標を提案する。
- WinoBiasデータセット、特にテストセット2(T2)を用い、職業語を「person」に置き換えることで能力に基づくバイアスを分離してバイアスを調査する。
- 推論時に注意スコアを調整することで、オンライン歪み低減を実装し、男性代名詞へのバイアスを低減する。
- 事前学習済みELMoのデバイアス化手法を参考に、男性・女性の参照が等しいバランスの取れたデータセットを作成し、BERTを微調整するためのデータ拡張を実施する。
- 元のデータセットおよび拡張済みデータセットの両方でBERTを微調整し、WinoBias T2で歪みおよびステレオタイプ指標を用いてバイアスを評価する。
- 能力レベル(無能、中立、有能)ごとの性別比を分析し、職業を超えた残存バイアスを検出する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みおよび微調整済み言語モデルにおける性別バイアスを、従来の代名詞・ステレオタイプ関連にとどまらず、どのようによりよく定量化できるか?
- RQ2出荷時モデルにおいて、歪み(全体的な代名詞への好み)とステレオタイプ(職業に基づくバイアス)の間にトレードオフが存在するか?
- RQ3微調整時のデータ拡張が、BERTにおける歪みとステレオタイプの両方を効果的に低減できるか?
- RQ4WinoBiasのような現在のベンチマークが、職業に関する性別バイアスを真に分離しているのか、それとも性格や能力などの他のステレオタイプによって混同されているのか?
- RQ5言語モデルが、認識される能力など非職業的属性を通じてバイアスを示すことはあるのか、そしてそのようなバイアスはどのように測定できるか?
主な発見
- 出荷時モデルにおいて、歪みとステレオタイプの間に強い負の相関が認められ、全体的な代名詞への好みと職業に基づくバイアスの間にはトレードオフが存在することが示唆された。
- DistilBERTとBERTは高い歪みと低いステレオタイプを示したが、RoBERTaとALBERT-xxlargeは低い歪みだが高いステレオタイプを示した。
- オンライン歪み低減は歪みを低減するが、ステレオタイプを増大させることが確認され、意図した効果とは逆の結果となった。
- 微調整時のデータ拡張は、元の微調整に比べて歪みとステレオタイプの両方を低減することが確認され、バイアス低減に有効であることが示された。
- 職業バイアスを低減した後でも、モデルは能力に基づく代名詞解決において性別不均衡を示し、BERT-Aでは「無能」カテゴリにおける女性代名詞の使用率が0.156から0.281に上昇した。これは残存バイアスを示している。
- 現在のベンチマーク、たとえばWinoBiasやWinogenderは、性格や能力などの他のステレオタイプからの相関が重なっているため、職業バイアスを完全に分離できていない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。