Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Learning for Fair Representations

Aili Shen, Xudong Han|arXiv (Cornell University)|Sep 22, 2021
Adversarial Robustness in Machine Learning参考文献 36被引用数 19
ひとこと要約

本論文では、タスクの正答率と公平性の両方を同時に最適化することで、ニューラル分類器の表現におけるバイアスを低減する、コントラスト学習に基づく手法を提案する。この手法は、同じメインタスクラベルを持つインスタンスを引き寄せる一方で、保護属性(例:性別、人種)を共有するインスタンスを引き離す。4つのNLPおよびビジョンベンチマークにおいて、最小限の計算コストで最先端の公平性を達成し、メインタスクの性能に低下を来さない。

ABSTRACT

Trained classification models can unintentionally lead to biased representations and predictions, which can reinforce societal preconceptions and stereotypes. Existing debiasing methods for classification models, such as adversarial training, are often expensive to train and difficult to optimise. In this paper, we propose a method for mitigating bias in classifier training by incorporating contrastive learning, in which instances sharing the same class label are encouraged to have similar representations, while instances sharing a protected attribute are forced further apart. In such a way our method learns representations which capture the task label in focused regions, while ensuring the protected attribute has diverse spread, and thus has limited impact on prediction and thereby results in fairer models. Extensive experimental results across four tasks in NLP and computer vision show (a) that our proposed method can achieve fairer representations and realises bias reductions compared with competitive baselines; and (b) that it can do so without sacrificing main task performance; (c) that it sets a new state-of-the-art performance in one task despite reducing the bias. Finally, our method is conceptually simple and agnostic to network architectures, and incurs minimal additional compute cost.

研究の動機と目的

  • 保護属性(例:性別、人種)とタスクラベルとの間の誤った相関が原因で生じるニューラル分類器のバイアスを是正すること。
  • 敵対的訓練などの既存のバイアス除去手法に伴う計算コストの高さや最適化の難しさといった制限を克服すること。
  • モデルアーキテクチャに依存せず、バイアスを低減しつつ高いメインタスク性能を維持できるシンプルな手法を開発すること。
  • コントラスト学習を活用して、タスククラス内での類似性と保護属性グループ内での非類似性を促進することで、公平な表現を学習できるかを検討すること。

提案手法

  • 標準のクロスエントロピー損失に加え、タスクラベルの類似性と保護属性の非類似性の両方を目的とする2つのコントラスト損失成分を組み合わせる。
  • 同じメインタスクラベルを持つインスタンスの表現間の類似性を最大化するコントラスト的目的関数を用いる。保護属性に関係なく、同じタスクラベルを持つインスタンスは類似した表現を持つようにする。
  • 同じ保護属性を持つがタスクラベルが異なるインスタンスの表現間の類似性を同時に最小化する。
  • 共有エンコーダーを用いてエンドツーエンドで学習し、保護属性は埋め込み関数の微調整には使用せず、コントラスト損失のガイドとしてのみ利用する。
  • モデルアーキテクチャに依存せず、追加パラメータを追加しないため、軽量で容易に統合可能である。
  • 自己教師ありの方法でコントラスト損失を適用し、データオーグメンテーションを用いて、タスクおよび保護属性の両ビューにおけるポジティブ・ペアとネガティブ・ペアを生成する。

実験結果

リサーチクエスチョン

  • RQ1コントラスト学習を用いて、ニューラル分類器のバイアスを低減する公平な表現を効果的に学習できるか?
  • RQ2タスクラベルと保護属性の両方のコントラスト損失を組み合わせることで、メインタスクの正答率を損なわせずに公平性が向上するか?
  • RQ3敵対的訓練およびポストプロセッシングベースのバイアス除去ベースラインと比較して、本手法は公平性と性能の両面で優れているか?
  • RQ4異なるデータ分布やクラス構造を持つ多様なNLPおよびコンピュータビジョンタスクにおいて、本手法は有効か?
  • RQ52値分類と多値分類の設定の違いが、コントラストバイアス除去手法の有効性に与える影響は何か?

主な発見

  • 提案手法Con*は、4つの評価タスク(Moji、Hate Speech、Bios、imSitu)において、メインタスクの正答率を損なわず、すべてのタスクで最先端の公平性を達成した。
  • バイナリ分類設定(看護師対外科医)のBiosデータセットにおいて、Con*はGAPを21.60(CE m)から4.88に、leakage@hを98.98から85.61に、leakage@ŷを93.67から85.61に低下させ、高い正答率を維持した。
  • バイナリ設定において、Con*はINLPおよび敵対的ベースラインを上回り、性別バイアスを53%低減した(CE mと比較)。
  • 4つのすべてのデータセットで、精度と公平性のトレードオフを最も良く達成し、競合するベースラインを一貫して上回った。
  • アブレーションスタディの結果、2つのコントラスト損失成分の両方が不可欠であることが確認された。いずれかの損失を除去すると、公平性の性能が著しく低下した。
  • t-SNE可視化の結果、Con*の表現は感情(メインタスク)ごとにクラスタリングされる一方で、人種(保護属性)ごとに混合していることが確認され、手法の設計目的が達成されていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。