Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Contrastive Learning for Improving Fairness in Self-Supervised Learning

Martin Q. Ma, Yao-Hung Hubert Tsai|arXiv (Cornell University)|Jun 5, 2021
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本稿では、性別や人種などの感受性属性を条件として用いることで、自己教師あり表現学習における公平性を向上させる条件付き対照学習(CCL)を提案する。正例と負例のペair選択をグループ内に制限することで、データ拡張と対照学習をグループ内に限定し、学習された表現におけるバイアスを低減する。7つのデータセットで最先端の下流タスク精度を維持しながら、18のメトリクスのうち11つで優れた公平性を達成した。

ABSTRACT

Contrastive self-supervised learning (SSL) learns an embedding space that maps similar data pairs closer and dissimilar data pairs farther apart. Despite its success, one issue has been overlooked: the fairness aspect of representations learned using contrastive SSL. Without mitigation, contrastive SSL techniques can incorporate sensitive information such as gender or race and cause potentially unfair predictions on downstream tasks. In this paper, we propose a Conditional Contrastive Learning (CCL) approach to improve the fairness of contrastive SSL methods. Our approach samples positive and negative pairs from distributions conditioning on the sensitive attribute, or empirically speaking, sampling positive and negative pairs from the same gender or the same race. We show that our approach provably maximizes the conditional mutual information between the learned representations of the positive pairs, and reduces the effect of the sensitive attribute by taking it as the conditional variable. On seven fairness and vision datasets, we empirically demonstrate that the proposed approach achieves state-of-the-art downstream performances compared to unsupervised baselines and significantly improves the fairness of contrastive SSL models on multiple fairness metrics.

研究の動機と目的

  • 性別や人種などの感受性属性から生じるバイアスをモデルが意図せず学習・拡散するという、対照的自己教師あり学習(SSL)における公平性の未解決問題に取り組むこと。
  • 事前学習中に感受性属性の影響を軽減しつつ、下流タスクに適した高品質な表現を維持する手法を開発すること。
  • SSLモデルにおけるデモグラフィックパリティ、等しいオッズ、機会の平等といった公平性メトリクスを改善すること。
  • 感受性属性を条件として対照学習を条件づけることで、公平かつ下流タスクに有効な表現が得られることを示すこと。
  • 既存の対照的SSLフレームワークに容易に統合可能な、シンプルでプラグイン互換性のあるソリューションを提供すること。

提案手法

  • CCLは、感受性属性Zに基づいて正例と負例ペアのサンプリングを条件づけ、正例および負例ペアが同じグループ(例:同じ性別または人種)から選ばれるようにする。
  • 本手法は、各感受性属性グループ内でデータ拡張と対照学習を実行し、モデルが感受性属性を正例と負例の区別に使うのを難しくする。
  • CCLは、条件付き相互情報量I(X;Y|Z)の下界を最大化する。この量は感受性変数Zの情報を明示的に除外するため、Zの影響を学習された表現に低減する。
  • アプローチは、感受性属性ごとにデータをグループ化し、各グループ内で対照学習を実行することで実装され、SimCLRのような既存のSSLフレームワークに容易に統合可能である。
  • よりタイトな下界を最適化する、Tight-CCLというバリエーションも提案され、公平性の向上に寄与する。
  • 標準的な公平性メトリクスと下流タスクの精度を、複数の視覚および表形式データセットを用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1対照的自己教師あり学習は、性別や人種といった感受性属性からのバイアスを意図せず学習・拡散する可能性があるか?
  • RQ2下流タスクのパフォーマンスを損なわず、感受性属性の影響をどのように低減できるか?
  • RQ3感受性属性を条件として対照学習を条件づけることで、公平かつ下流タスクに有効な表現が得られるか?
  • RQ4既存の公平性に配慮した自己教師あり学習手法と比較して、CCLの公平性と精度はどのように異なるか?
  • RQ5感受性属性でグループ化するというシンプルでモジュラーな対照学習の修正は、性能を維持しながら最先端の公平性を達成できるか?

主な発見

  • CCLは、5つの公平性と2つの視覚データセットで、18の公平性メトリクスのうち11つですべてのベースラインを上回り、公平性の顕著な向上を示した。
  • CelebAデータセットの魅力的な属性予測タスクでは、CCLがデモグラフィックパリティ差(ΔDP)を0.202 ± 0.03にまで低減したのに対し、SimCLRは0.277 ± 0.04であった。これはバイアスの低減を示している。
  • UTKFaceデータセットにおける性別予測タスクでは、CCLが等しいオッズ差(ΔEO)を0.156 ± 0.02にまで低減したのに対し、SimCLRは0.421 ± 0.04であった。これは顕著な公平性の向上を示している。
  • 視覚データセットの4つのタスクすべてで、CCLは下流タスク精度を維持または向上させ、CelebAの魅力的な属性予測タスクで最高の精度82.1 ± 0.24%を達成した。
  • Tight-CCLは、ΔDP = 0.198 ± 0.03というより高い公平性を一部のメトリクスで達成し、条件付き相互情報量のタイトな下界を最適化することでバイアス低減が向上することを示唆している。
  • 表形式データセットでは1つのGPUで100エポックの学習が1時間未塔、視覚データセットでは20〜24時間で完了し、効率的な学習が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。