Skip to main content
QUICK REVIEW

[論文レビュー] Representative & Fair Synthetic Data

Paul Tiwald, Alexandra Ebert|arXiv (Cornell University)|Apr 7, 2021
Ethics and Social Impacts of AI参考文献 7被引用数 7
ひとこと要約

本稿では、自己教師あり学習における生成モデルの訓練に公平性制約(特に統計的平等性)を統合することで、代表的かつ公平な合成表形式データを生成するフレームワークを提案する。モデルの目的関数に公平性損失を追加することにより、UCI Adultデータセットにおける性別および人種的バイアスが軽減され、統計的関係が保持される。その結果、明示的な公平性最適化を施さない後続のモデルでも、保護されたグループにほぼ等しい感受性スコアが割り当てられるようになった。

ABSTRACT

Algorithms learn rules and associations based on the training data that they are exposed to. Yet, the very same data that teaches machines to understand and predict the world, contains societal and historic biases, resulting in biased algorithms with the risk of further amplifying these once put into use for decision support. Synthetic data, on the other hand, emerges with the promise to provide an unlimited amount of representative, realistic training samples, that can be shared further without disclosing the privacy of individual subjects. We present a framework to incorporate fairness constraints into the self-supervised learning process, that allows to then simulate an unlimited amount of representative as well as fair synthetic data. This framework provides a handle to govern and control for privacy as well as for bias within AI at its very source: the training data. We demonstrate the proposed approach by amending an existing generative model architecture and generating a representative as well as fair version of the UCI Adult census data set. While the relationships between attributes are faithfully retained, the gender and racial biases inherent in the original data are controlled for. This is further validated by comparing propensity scores of downstream predictive models that are trained on the original data versus the fair synthetic data. We consider representative & fair synthetic data a promising future building block to teach algorithms not on historic worlds, but rather on the worlds that we strive to live in.

研究の動機と目的

  • 機械学習におけるシステム的バイアスを解消するため、データ生成段階で公平性を制御すること。
  • 元のデータと同等に代表的であり、性別や人種といった保護属性に関して公平な合成データを生成する手法を開発すること。
  • 公平性を直接データ生成プロセスに埋め込むことで、学習アルゴリズムを変更せずに後続のモデルにおけるバイアスを低減できることを示すこと。
  • 合成データ生成における公平性制約が、プロキシバイアスを効果的に低減し、データ品質を維持できることを検証すること。

提案手法

  • 生成モデルの訓練目的関数に、標準的な精度損失に加えて公平性損失を統合し、データの忠実性と公平性の両方を最適化する。
  • 公平性の定義として統計的平等性を用い、保護されたグループ(例:男性対女性)間で正の結果(例:高収入)の確率が等しくなるように定義する。
  • 公平性損失を、経験的統計的平等性からの逸脱に比例するペナルティとして定式化し、重み付き損失の組み合わせによって精度と公平性のトレードオフを制御可能にする。
  • 性別と人種を保護属性として、Adultデータセット上でエンドツーエンドにモデルを訓練し、合成段階で公平性制約を適用する。
  • 元のデータの単変量および二変量統計的分布を保持することで、合成サンプルの代表的性を保証する。
  • 後続のロジスティック回帰モデルの感受性スコアを分析することで、合成データと元のデータを用いて訓練したモデルの公平性を評価する。

実験結果

リサーチクエスチョン

  • RQ1公平性制約を効果的にデータ生成プロセスに組み込むことで、代表的かつ公平な合成データを生成できるか?
  • RQ2公平性損失を伴う生成モデルの訓練が、明示的な公平性最適化を施さない後続の予測モデルにおけるバイアスを低減できるか?
  • RQ3公平性制約は、感受性属性を間接的に表現するプロキシ変数をどの程度カバーできるか?
  • RQ4性別と人種の両方の公平性制約を同時に適用した場合、交差グループ(例:白人男性、黒人女性)間の結果バランスにどのような影響を与えるか?

主な発見

  • 性別に関する不平等影響比は、合成データで0.88を達成し、四分の五のルール(0.8)を上回った。これに対して元のデータでは0.33であり、顕著なバイアス低減が確認された。
  • 元のデータの単変量および二変量統計的分布が、合成データにおいても保持されており、高い代表的性が裏付けられた。
  • 性別とプロキシ属性の相関は維持されたが、プロキシ属性と収入の相関は顕著に低減され、プロキシバイアスの効果的な低減が示された。
  • 合成データを用いて訓練した後続のロジスティック回帰モデルでは、モデル訓練段階で公平性制約を適用していないにもかかわらず、男性と女性にほぼ等しい感受性スコアが割り当てられた。
  • 合成モデルは競争力のある性能(84.13%の正確度、88.34%のAUC)を達成しており、公平性の実現が予測性能の低下を伴わないことを示した。
  • 人種と性別の両方の公平性制約を同時に適用した場合、すべての4つの交差グループ(例:白人男性、黒人女性)における高収入率が顕著にバランスが取られ、公平性損失の重みを増やすことでさらなる改善が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。