[論文レビュー] Unmasking the Mask -- Evaluating Social Biases in Masked Language Models
本稿では、マスクされたトークンの選択バイアスを回避し、信頼性を向上させるために、一括して未マスクトークンを予測するという新しい手法であるAll Unmasked Likelihood (AUL) および AUL with Attention weights (AULA) を提案する。これらの手法は、従来の方法に見られる限界を克服し、性別、人種、職業に関するステレオタイプの偏見を検出する際、人間がアノテートしたバイアス評価と高い整合性を示し、より高い精度を達成する。AULおよびAULAは、StereoSetおよびCrowS-Pairsデータセットにおいて、既存のメトリクスを上回る性能を示した。
Masked Language Models (MLMs) have shown superior performances in numerous downstream NLP tasks when used as text encoders. Unfortunately, MLMs also demonstrate significantly worrying levels of social biases. We show that the previously proposed evaluation metrics for quantifying the social biases in MLMs are problematic due to following reasons: (1) prediction accuracy of the masked tokens itself tend to be low in some MLMs, which raises questions regarding the reliability of the evaluation metrics that use the (pseudo) likelihood of the predicted tokens, and (2) the correlation between the prediction accuracy of the mask and the performance in downstream NLP tasks is not taken into consideration, and (3) high frequency words in the training data are masked more often, introducing noise due to this selection bias in the test cases. To overcome the above-mentioned disfluencies, we propose All Unmasked Likelihood (AUL), a bias evaluation measure that predicts all tokens in a test case given the MLM embedding of the unmasked input. We find that AUL accurately detects different types of biases in MLMs. We also propose AUL with attention weights (AULA) to evaluate tokens based on their importance in a sentence. However, unlike AUL and AULA, previously proposed bias evaluation measures for MLMs systematically overestimate the measured biases, and are heavily influenced by the unmasked tokens in the context.
研究の動機と目的
- マスクされたトークンの予測精度が低く、文脈に起因するバイアスを無視するという問題により、従来のバイアス評価メトリクスが信頼性に欠けることに対処する。
- 頻度の高い語のマスクが繰り返されることが原因で生じる選択バイアスを是正し、歪んだトークン頻度分布がバイアス測定を歪めるのを防ぐ。
- 微調整や文脈依存的予測によって生じるバイアスとは分離し、モデルの内在的バイアスを隔離して評価する手法を開発する。
- 自己注意機構の重みを組み込むことで、トークンの重要性を反映させ、自動バイアススコアと人間によるアノテート済みバイアス評価の整合性を向上させる。
- 現在の評価メトリクスが、トークンの独立性に関する誤った仮定と低い予測信頼度に基づくため、バイアスを系統的に過大評価していることの解明
提案手法
- マスクされたトークンの予測に依存せず、文のすべての未マスクトークンを同時に予測するためのAll Unmasked Likelihood (AUL) を提案。全未マスク入力埋め込みを用いることで、マスクに起因する歪みを回避する。
- 自己注意スコアに基づいてトークンの尤度を再重み付けするAUL with Attention weights (AULA) を導入。意味的に重要な語を優先し、機能語によるノイズを低減する。
- 予測されたトークンの擬似尤度をバイアススコアとして用い、反ステレオタイプ的文において尤度が低いほど検出されたバイアスが高くなるように定義する。
- AULおよびAULAを、StereoSet (SS) および CrowS-Pairs (CP) の2つのベンチマークデータセットに適用し、SSS や CPS といった既存のメトリクスと性能を比較する。
- バイナリ分類タスク(ROC-AUC)を用いてバイアス検出をキャリブレーションし、MLMベースのスコアと人間によるアノテート済みバイアスラベルの一致度を評価する。
- トークンの順序を入れ替える、または意味のない語に置き換えることで、AULの文の構造や意味的関連性への感受性をテストするアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1MLM向けの既存バイアス評価メトリクスは、曖昧な文脈における擬似尤度依存と低いマスクトークン予測精度により、どの程度失敗するのか?
- RQ2頻度の高い語に偏ったマスク頻度バイアスが、従来のバイアス評価メトリクスの信頼性にどのように影響するのか?
- RQ3すべての未マスクトークンを同時に予測するバイアス評価手法は、ノイズを低減し、MLMにおける社会的バイアスの検出をどのように改善できるか?
- RQ4CrowS-PairsおよびStereoSetにおいて、AULおよびAULAは既存メトリクスと比較して、人間によるアノテート済みバイアス判断とどの程度整合性を示すか?
- RQ5自己注意機構が、意味的に重要なトークンを適切に重み付けすることで、バイアス評価をどの程度改善できるか?
主な発見
- AULは、StereoSetデータセットにおいて、従来の擬似尤度ベースの手法と比較して95.71ポイントの精度低下を示し、反ステレオタイプ的応答を正しく検出する信頼性の向上を示した。
- AULAはCrowS-Pairsにおいて、すべての既存メトリクスを上回り、ROC-AUC曲線を通じて人間のバイアス評価ラベルとの一致度が最も高かった。特に微細なバイアスの検出において優れた性能を示した。
- 提案手法AULは、文の構造と意味に敏感であることが示された。トークンの順序をランダムに並び替える、または意味のない語に置き換えると、顕著な性能低下が観察された。
- CPS や SSS といった従来メトリクスは、マスク頻度バイアスと独立性仮定の誤りにより、バイアスを系統的に過大評価していた。特に、頻度の高い語がマスクされた場合、反ステレオタイプ的文が「より少ないバイアス」と誤って評価された。
- Bert、RoBERTa、ALBERTを含む、すべての評価対象のMLMが、深刻な社会的バイアスを示しており、内在的バイアスが特定のアーキテクチャに限定されない広範な問題であることを確認した。
- AULおよびAULAは、さまざまなMLMおよびバイアスタイプに対して頑健であり、AULAは特に複雑で文脈依存性の高い状況において、人間によるアノテート済みバイアス結果と最も強い相関を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。