Skip to main content
QUICK REVIEW

[論文レビュー] Detoxifying Language Models Risks Marginalizing Minority Voices

Albert Xu, Eshaan Pathak|arXiv (Cornell University)|Apr 13, 2021
Topic Modeling参考文献 25被引用数 11
ひとこと要約

この論文は、有毒な出力を低減することを目的とした言語モデルのデトックス化技術が、意図せず公平性を損なうことを示している。具体的には、アフリカ系アメリカ英語(AAE)およびマイノリティ・アイデンティティ・メンション(MIM)の文脈で、パーキュリティ(perplexity)が著しく上昇し、生成品質が劣化する傾向がある。その根本的原因は、毒性データセットにおける誤った相関関係に起因する。すなわち、アノテーションおよびサンプリングバイアスの影響により、AAEやMIMが毒性ラベルに過剰に関連付けられており、結果としてデトックス化手法がこれらの言語的特徴を誤って抑制してしまう。

ABSTRACT

Language models (LMs) must be both safe and equitable to be responsibly deployed in practice. With safety in mind, numerous detoxification techniques (e.g., Dathathri et al. 2020; Krause et al. 2020) have been proposed to mitigate toxic LM generations. In this work, we show that current detoxification techniques hurt equity: they decrease the utility of LMs on language used by marginalized groups (e.g., African-American English and minority identity mentions). In particular, we perform automatic and human evaluations of text generation quality when LMs are conditioned on inputs with different dialects and group identifiers. We find that detoxification makes LMs more brittle to distribution shift, especially on language used by marginalized groups. We identify that these failures stem from detoxification methods exploiting spurious correlations in toxicity datasets. Overall, our results highlight the tension between the controllability and distributional robustness of LMs.

研究の動機と目的

  • デトックス化技術が、アフリカ系アメリカ英語(AAE)やマイノリティ・アイデンティティ・メンション(MIM)といった言語的マイノリティ表現の性能に悪影響を及えるかどうかを調査すること。
  • 観察された性能低下が、AAEやMIMを毒性と誤って関連づけるデータセット内の誤った相関関係に起因するかどうかを検証すること。
  • デトックス化の強度が、さまざまな方言およびアイデンティティ・マーカーにおけるモデルの有用性に与える影響を評価すること。
  • 現実のNLP展開において、偏ったデトックス化がもたらす表現上の害やステグマ化リスクを浮き彫りにすること。

提案手法

  • 本研究では、4つの最先端のデトックス化技術を用いる:ドメイン適応型事前学習(DAPT)、プラグアンドプレイ言語モデル(PPLM)、GeDi、および毒性分類器を用いた出力フィルタリング。
  • すべての手法は、低アノテーション合意度の例を除外した後、Jigsaw Civil Commentsデータセットで微調整されたGPT-2 mediumに適用される。
  • AAEまたはMIMを含むプロンプトと、ホワイト・アライド・イングリッシュ(WAE)を含むプロンプトとの間で、パーキュリティを測定し、デトックス化強度の異なるレベルでの比較を行う。
  • クラウドワーカーによる人間評価を通じて、WAEプロンプトとAAEプロンプトの両方に対して生成された完成文の流れ、スタイル、トピックの一貫性を評価する。
  • 解析により、アノテーションバイアス(AAEを誤って毒性とラベル付け)およびサンプリングバイアス(しばしばマイノリティグループを標的にする毒性コメント)の影響により、毒性データセットにAAE/MIMと毒性ラベルの誤った相関関係が存在することが判明した。
  • ハイパーパrameter(例:GeDiにおけるω)を変化させることで、デトックス化強度の増加がAAEおよびMIMにおける性能低下を顕著にすることを示した。

実験結果

リサーチクエスチョン

  • RQ1言語モデルのデトックス化は、ホワイト・アライド・イングリッシュ(WAE)と比較して、アフリカ系アメリカ英語(AAE)およびマイノリティ・アイデンティティ・メンション(MIM)の文脈で、パーキュリティを著しく上昇させるか?
  • RQ2デトックス化の強度を高めることで、AAEおよびMIMにおける性能劣化がどの程度悪化するか?
  • RQ3毒性データセット内の誤った相関関係が、なぜAAEおよびMIMの抑制を引き起こすのか?
  • RQ4AAEプロンプトとWAEプロンプトの両方に対して生成されたテキストについて、人間評価ではデトックス化モデルの性能はどのように異なるか?
  • RQ5デトックス化されたモデルがマイノリティの言語的アイデンティティを無視する場合、そのような展開がもたらす表現的および社会的害は何か?

主な発見

  • デトックス化技術は、AAEおよびMIMのテキストにおいてパーキュリティを著しく上昇させ、ベースラインモデルですでにAAEのパーキュリティがWAEの約3倍にのぼっている。
  • 強いデトックス化(例:GeDiにおける高ω)が適用された場合、AAEのパーキュリティはWAEの約400倍にまで上昇し、モデルの有用性が著しく低下していることが示された。
  • 人間評価では、デトックス化モデルがAAEプロンプトから生成する際、WAEプロンプトと比較して、流れ、スタイル、トピックの一貫性を維持できていないことが判明した。
  • 性能劣化は特定のデトックス化手法に限定されるものではなく、DAPT、PPLM、GeDi、およびフィルタリングのすべての手法で一貫して観察された。これは、偏ったデータに起因する根本的なシステム的問題を示している。
  • アノテーションバイアス(AAEを誤って毒性とラベル付け)およびサンプリングバイアス(毒性コメントがしばしばマイノリティグループを標的にする)によって、毒性データセット内にAAE/MIMと毒性ラベルの誤った相関関係が生じており、これがデトックス化モデルがAAEおよびMIMを避ける原因となっている。
  • デトックス化強度を高めることでバイアスが顕著に増幅され、問題が一時的な副作用ではなく、現在のデトックス化パイプラインに内在する構造的欠陥であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。