Skip to main content
QUICK REVIEW

[論文レビュー] Should We Attend More or Less? Modulating Attention for Fairness

Abdelrahman Zayed, Gonçalo Mordido|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、微調整後のアテンション分布のエントロピーを調整することで、最小限の性能低下でNLPモデルの公平性を向上させる、新しいイントラプロセッシング手法EAT(エントロピーに基づくアテンション温度スケーリング)を提案する。アテンションログィットの温度を動的に調整することにより、テキスト分類および生成タスクの全般的なジェンダー、人種、宗教、その他の社会的バイアスにおいて、公平性が向上し、既存手法を上回る性能を発揮する。性能低下は3.5%未満に抑えられる。

ABSTRACT

The advances in natural language processing (NLP) pose both opportunities and challenges. While recent progress enables the development of high-performing models for a variety of tasks, it also poses the risk of models learning harmful biases from the data, such as gender stereotypes. In this work, we investigate the role of attention, a widely-used technique in current state-of-the-art NLP models, in the propagation of social biases. Specifically, we study the relationship between the entropy of the attention distribution and the model's performance and fairness. We then propose a novel method for modulating attention weights to improve model fairness after training. Since our method is only applied post-training and pre-inference, it is an intra-processing method and is, therefore, less computationally expensive than existing in-processing and pre-processing approaches. Our results show an increase in fairness and minimal performance loss on different text classification and generation tasks using language models of varying sizes. WARNING: This work uses language that is offensive.

研究の動機と目的

  • アテンションエントロピーとNLPモデルの公平性の関係を調査すること。
  • 微調整済みのBERTおよびRoBERTaモデルにおけるジェンダーおよびその他の社会的バイアスを、再トレーニングなしで是正すること。
  • トレーニング後にアテンション分布を変更する、計算効率の高いイントラプロセッシング手法を開発すること。
  • ジェンダーにとどまらず、人種、宗教、性的指向など多様な社会的バイアスに一般化できるかを評価すること。
  • GPT-Neoを用いたテキスト生成タスクへの手法の拡張

提案手法

  • EATは、微調整後のアテンションログィットに温度スケーリングを適用し、アテンション分布のエントロピーを調整する。
  • 温度ハイパーパrameterは、バリデーションデータを用いてジェンダーバイアスのみでチューニングされる。
  • この手法は推論時のみに適用され、軽量かつ任意の事前学習済みモデルと互換性がある。
  • EATは、既存のインプロセッシングおよびプレプロセッシングのバイアス是正手法と組み合わせ、追加の公平性向上を評価する。
  • 手法は3つのテキスト分類データセットで評価され、BOLDベンチマークを用いてテキスト生成への応用が拡張された。
  • 感情分析にはVADERが用いられ、モデル出力のバイアスを測定する。生成品質の評価にはパープレキシティが使用された。

実験結果

リサーチクエスチョン

  • RQ1微調整済みのBERTおよびRoBERTaモデルにおいて、アテンション分布のエントロピーは公平性と性能にどのように関係しているか?
  • RQ2微調整後のアテンションエントロピーの調整によって、顕著な性能低下を伴わずに公平性が向上するか?
  • RQ3提案されたEAT手法は、ジェンダーにとどまらず、人種、宗教、障害など、他の社会的バイアスに対しても一般化可能か?
  • RQ4EATは、他のインプロセッシング、インプロセッシング、プレプロセッシングのバイアス是正手法と比較して、公平性およびロバスト性において優れているか?
  • RQ5EATは、GPT-Neoのようなテキスト生成モデルに効果的に適用可能で、社会的バイアスを是正できるか?

主な発見

  • EATは、全テストバイアスタイプにおいて最高の公平性ランクを達成し、他のイントラプロセッシング手法と比較して83%の状況で優れた性能を示した。
  • EATは、すべてのテキスト分類タスクで3.5%未満の性能低下をもたらしたが、ランダムノイズの影響を除いては、すべてのケースで同様の結果を示した。
  • EATは、全デモグラフィックグループにおいてモデル生成のネガティブな感情を低減したが、パープレキシティは低く維持された。
  • ジェンダーバイアスでのみチューニングされたハイパーパrameterが、人種、宗教、障害など、他の社会的バイアスに対しても効果的に一般化された。
  • EATを既存のインプロセッシングおよびプレプロセッシング手法と組み合わせることで、すべての設定で一貫して公平性が向上した。
  • バリデーションとテストのテンプレートでデータ分布が異なる状況でも、EATはロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。