Skip to main content
QUICK REVIEW

[論文レビュー] Towards Controllable Biases in Language Generation

Emily Sheng, Kai-Wei Chang|arXiv (Cornell University)|May 1, 2020
Topic Modeling参考文献 30被引用数 11
ひとこと要約

本稿では、勾配ベースの adversarial triggers を用いて自然言語生成(NLG)における社会的バイアスの誘発および是正を可能にするモデルに依存しないフレームワークを提案する。デモグラフィック要因が含まれるプロンプトの先頭にトリガーを付加することで、特定のグループに対するバイアス極性(否定的、中立的、肯定的)を制御可能となり、バイアス分析と是正の両方が可能である。GPT-2の出力においても、デモグラフィックごとのバイアスの均等化が有効に実現され、否定的バイアスが低減されていることが示された。

ABSTRACT

We present a general approach towards controllable societal biases in natural language generation (NLG). Building upon the idea of adversarial triggers, we develop a method to induce societal biases in generated text when input prompts contain mentions of specific demographic groups. We then analyze two scenarios: 1) inducing negative biases for one demographic and positive biases for another demographic, and 2) equalizing biases between demographics. The former scenario enables us to detect the types of biases present in the model. Specifically, we show the effectiveness of our approach at facilitating bias analysis by finding topics that correspond to demographic inequalities in generated text and comparing the relative effectiveness of inducing biases for different demographics. The second scenario is useful for mitigating biases in downstream applications such as dialogue generation. In our experiments, the mitigation technique proves to be effective at equalizing the amount of biases across demographics while simultaneously generating less negatively biased text overall.

研究の動機と目的

  • 自然言語生成(NLG)モデルにおける社会的バイアスを制御する一般的でモデルに依存しない手法の開発。
  • デモグラフィック不平等に関連するトピックを分析することで、NLG出力におけるバイアスの現れ方を解明すること。
  • 異なるデモグラフィックグループにおけるバイアス誘発の相対的有効性を評価し、モデルの限界を明らかにすること。
  • 否定的バイアスを低減し、デモグラフィックごとにバイアス極性を均等化する戦略の設計および評価。
  • この手法が NLG モデル全体および下流の対話システムにおける未確認名に対しても一般化可能であることを実証すること。

提案手法

  • 本手法は、勾配ベースの adversarial trigger 検索を用い、入力プロンプトの先頭に付加することで、生成テキストのバイアス極性に影響を与える短いトリガー語句を同定する。
  • フレームワークでは、特定のデモグラフィックグループに対する社会的認識への影響として、バイアス極性を否定的、中立的、肯定的と定義し、特定の極性を誘発または是正する目的関数を設定する。
  • トリガーは、指定されたデモグラフィック要因の関連するバイアスシフトを最大化するように、ターゲットサンプルからの勾配を用いて最適化される。
  • 本手法は GPT-2 および対話モデル(DialoGPT)に適用され、自動的および人間によるバイアススコアの両方で評価が行われた。
  • 是正は、否定的バイアスを低減し、デモグラフィック間のバイアス比を均等化するようにトリガーを訓練することで実現され、確認済みおよび未確認の名前に対してテストされた。
  • デモグラフィックバイアスの不均衡に関連するトピックは、異なるトリガー条件下での生成テキストの内容を分析することで特定された。

実験結果

リサーチクエスチョン

  • RQ1デモグラフィック要因に基づいて、adversarial triggers を用いて NLG 出力に体系的に否定的、中立的、肯定的バイアスを誘発できるか?
  • RQ2生成テキストにおいて、デモグラフィックバイアスの不均衡と強く関連するトピックは何か?
  • RQ3バイアス誘発の有効性は、異なるデモグラフィックグループ間でどのように変化するか? これによりモデルの限界がどのように明らかになるか?
  • RQ4NLG モデルにおいて、バイアスを是正し、デモグラフィック間でバイアス極性を均等化するようにトリガーを設計できるか?
  • RQ5是正用トリガーは未確認の名前に一般化可能であり、実世界の対話アプリケーションでも効果を維持できるか?

主な発見

  • 是正用トリガーにより、Black と White の名前の間の平均 regard スコアの差が 0.25 から 0.01 に低下し、バイアスの均等化が有効に実現された。
  • 確認済みおよび未確認の名前に対して、是正用トリガーは一貫した性能を維持し、デモグラフィック名全体にわたる一般化性が示された。
  • Black 名の平均 regard スコアは 0.38 から 0.53 に上昇し、White 名のスコアは 0.37 から 0.52 に上昇し、中立的および肯定的バイアスへの顕著なシフトが示された。
  • 本手法は、race-Black に対して否定的バイアスを誘発し、race-White に対して肯定的バイアスを誘発することに成功し、国際関係関連の言及が増加するなど、トピックレベルの不均衡が明らかになった。
  • race-White に対して否定的バイアスを誘発するのは、race-Black よりも難しく、sexual-orientation-straight に対しては、sexual-orientation-gay よりも難しかったため、モデルのバイアス感受性における非対称性が示された。
  • 人間による評価では自動バイアススコアが確認され、アノテーター間の整合性は 0.71、人間ラベルと自動ラベルの相関係数は 0.66 であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。