[論文レビュー] Debiasing isn't enough! -- On the Effectiveness of Debiasing MLMs and their Social Biases in Downstream Tasks
この論文は、マスクされた言語モデル(MLM)における内的バイアス評価と外的バイアス評価の乖離を調査し、両者の間には弱い相関しか見られないことを発見した。デバイアス化を行った後でさえ、MLMはファインチューニング中に偏見を再学習する。これは、訓練インスタンスとラベルの偏りに起因し、デプロイ意思決定における内的評価の信頼性を損なう。
We study the relationship between task-agnostic intrinsic and task-specific extrinsic social bias evaluation measures for Masked Language Models (MLMs), and find that there exists only a weak correlation between these two types of evaluation measures. Moreover, we find that MLMs debiased using different methods still re-learn social biases during fine-tuning on downstream tasks. We identify the social biases in both training instances as well as their assigned labels as reasons for the discrepancy between intrinsic and extrinsic bias evaluation measurements. Overall, our findings highlight the limitations of existing MLM bias evaluation measures and raise concerns on the deployment of MLMs in downstream applications using those measures.
研究の動機と目的
- MLMにおけるタスクに依存しない内的バイアス評価とタスクに依存する外的バイアス評価の関係を検討すること。
- 下流タスクでファインチューニングされた際に、デバイアス化されたMLMが依然として偏見のない状態を保つのかを調査すること。
- 内的バイアス評価と外的バイアス評価の測定値に差が生じる主な要因を同定すること。
- 内的バイアス評価のみで十分であるという仮定を疑うこと。
- MLMを用いたNLPシステムにおける現在のバイアス評価手法の限界を浮き彫りにすること。
提案手法
- 3つの内的バイアス評価指標(SSS、CPS、AULA)を用いて、7つの事前学習済みMLMとそのデバイアス化版を評価した。
- MLMの有効性を評価するために、3種類の異なるデバイアス化手法を適用した。
- 下流タスクでの外的バイアス行動を評価するために、3つのデータセット(BiasBios、STS-bias、NLI-bias)でファインチューニングを実施した。
- ファインチューニング前後における内的バイアススコアと外的バイアススコアの間のケンダールのtau相関係数を計算した。
- ファインチューニング中にバイアスの再エンコードが生じる原因を特定するために、訓練インスタンスとラベルを分析した。
- 観察された評価タイプ間の相関の信頼性を評価するために、統計的有意性検定(p < 0.05)を用いた。
実験結果
リサーチクエスチョン
- RQ1MLMにおいて、内的バイアス評価指標と外的バイアス評価指標の間に強い相関が存在するか?
- RQ2デバイアス化されたMLMは、下流タスクでファインチューニングされた後も、依然としてデバイアス状態を保っているか?
- RQ3下流タスクのファインチューニング中にバイアスの再エンコードが生じる主な要因は何か?
- RQ4内的バイアス評価のみでMLMがデプロイに適しているかどうかを信頼してよいのか?
- RQ5異なるデバイアス化手法は、内的バイアス評価フレームワークと外的バイアス評価フレームワークの両方で、どのように性能を発揮するか?
主な発見
- テストされたすべてのMLMとデータセットにおいて、内的バイアス評価指標と外的バイアス評価指標の間には、弱く一貫性のない相関しか存在しない。
- NLI-biasではファインチューニング後に内的評価と外的評価の相関が低下した(0.22から0.21に)。他のタスクでは相関は低いままであった。
- ファインチューニング後の統計的に有意な相関は、STS-biasとSSSの間でのみ観察された(τ = 0.38)。これはファインチューニング前の値(0.53)よりも低かった。
- デバイアス化されたMLMは、訓練データのインスタンス関連の偏りと、ラベルに起因する偏りにより、ファインチューニング中に社会的バイアスを再学習する。
- デバイアス化を行った後でも、内的バイアス評価と外的バイアス評価の乖離は継続するため、デプロイ評価には内的評価のみでは不十分である。
- 本研究では、下流タスクにおけるデータの内容とラベルの割り当ての両方が、バイアスの再エンコードに寄与していることが同定され、孤立した内的評価の信頼性に疑問が呈された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。