Skip to main content
QUICK REVIEW

[論文レビュー] Fair Generative Modeling via Weak Supervision

Kristy Choi, Aditya Grover|arXiv (Cornell University)|Oct 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 71被引用数 15
ひとこと要約

本稿では、少量のラベルなしリファレンスデータセットを用いて、深層生成モデルのバイアスを軽減する弱教師付き生成モデリング手法を提案する。確率的分類器を用いて密度比を推定し、訓練サンプルを再重み付けすることで、CelebA上で最大34.6%の潜在的バイアスを低減する。生成品質への影響は最小限であり、バイアス要因の明示的ラベルなしに、データ効率的で公平な画像生成を実現する。

ABSTRACT

Real-world datasets are often biased with respect to key demographic factors such as race and gender. Due to the latent nature of the underlying factors, detecting and mitigating bias is especially challenging for unsupervised machine learning. We present a weakly supervised algorithm for overcoming dataset bias for deep generative models. Our approach requires access to an additional small, unlabeled reference dataset as the supervision signal, thus sidestepping the need for explicit labels on the underlying bias factors. Using this supplementary dataset, we detect the bias in existing datasets via a density ratio technique and learn generative models which efficiently achieve the twin goals of: 1) data efficiency by using training examples from both biased and reference datasets for learning; and 2) data generation close in distribution to the reference dataset at test time. Empirically, we demonstrate the efficacy of our approach which reduces bias w.r.t. latent factors by an average of up to 34.6% over baselines for comparable image generation using generative adversarial networks.

研究の動機と目的

  • ラベルなしで観測されない、レースや性別といった主要なデモグラフィック要因が潜在的である場合に、教師なし生成モデリングにおけるデータセットバイアスを是正すること。
  • 大規模でバイアスを含む訓練データセットのバイアスを是正するために、少量のラベルなしリファレンスデータセットを弱教師付きとして活用する、データ効率的な手法の開発。
  • テスト時に生成分布をリファレンスデータセットの分布に近づけることで、生成品質を損なわずに公平性を向上させること。
  • バイアス属性の高価な明示的ラベリングを回避するため、少量のリファレンスセットからの密度比推定を用いること。

提案手法

  • 本手法は、バイアスのあるデータセットのサンプルが、バイアスあり分布とリファレンス分布の下での相対的尤度に基づき、訓練中に寄与度を再調整する重要度再重み付けを用いる。
  • 密度比は、バイアスありデータセットとリファレンスデータセットを区別するように訓練された二値分類器を用いて推定し、直接的な密度推定を回避する。
  • 分類器の出力スコアを重要度重みとして用い、バイアスのあるデータにおける代表が不足しているサブグループに重点を置いた訓練サンプルの再重み付けを実現する。
  • 再重み付けされた損失は、GANの敵対的訓練に適用され、生成器がリファレンス分布に整合したより公平なデータ分布を学習できるようにする。
  • 本アプローチはモデルに依存せず、GAN、VAE、ノーマライジングフローを含むさまざまな生成モデルに適用可能である。
  • リファレンスデータセットはバイアス要因に関してラベル付けされていなくてもよく、バイアスのあるデータセットよりもはるかに小さくてもよく、弱教師付きを実現する。

実験結果

リサーチクエスチョン

  • RQ1性別やレースといった潜在的デモグラフィック要因の明示的ラベルなしに、深層生成モデルのバイアスを低減できるか?
  • RQ2大規模でバイアスを含む訓練データセットのバイアス是正に、少量のラベルなしリファレンスデータセットをどのように活用できるか?
  • RQ3密度比推定に基づく重要度再重み付けは、生成サンプルの公平性をどの程度向上させられるか、かつ高品質なサンプルを維持できるか?
  • RQ4リファレンスデータセットからの弱教師付き情報のみで、データ効率的かつ公平な生成を達成できるか?

主な発見

  • 提案手法は、GANを用いた画像生成において、潜在的要因に関するバイアスを平均で最大34.6%まで低減し、単一属性設定ではバイアス=0.9のとき49.3%、バイアス=0.8のとき23.9%の改善を達成した。
  • 多属性バイアスにおいても、ベースラインと比較して平均で32.5%のバイアス低減を達成し、複雑なバイアス構造に対しても有効であることが示された。
  • 本手法は高いサンプル品質を維持しており、FIDなどの指標においてリファレンスデータセットと比較して顕著な劣化がなかった。
  • バイアス属性の明示的アノテーションが不要な少量のリファレンスデータセットを弱教師付きとして用いることで、効果的なバイアス是正が可能である。
  • 実験結果から、リファレンスセットが小さくても、生成分布がリファレンス分布に近づくことが明確に示された。
  • 本手法は、さまざまなレベルのデータセットバイアスに対して頑健であり、CelebAデータセットにおける単一属性および多属性バイアスの両状況に一般化可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。