Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Fairness Impact of Differentially Private Synthetic Data

Blake Bullwinkel, Kristen Grabarz|arXiv (Cornell University)|May 9, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿は、下流のバイナリ分類タスクにおける微分プライバシー(DP)合成データの公平性への影響を評価し、4つのDP合成器のうち3つがマイノリティグループの代表割合を低下させることで公平性を損なうことを発見した。マルチラベルアンダーサンプリングを用いた前処理により、この問題が緩和され、精度を損なわずに公平性が向上した。一方、MST合成器は前処理なしでも非プライベートデータと同等の公平性と精度を維持した。

ABSTRACT

Differentially private (DP) synthetic data is a promising approach to maximizing the utility of data containing sensitive information. Due to the suppression of underrepresented classes that is often required to achieve privacy, however, it may be in conflict with fairness. We evaluate four DP synthesizers and present empirical results indicating that three of these models frequently degrade fairness outcomes on downstream binary classification tasks. We draw a connection between fairness and the proportion of minority groups present in the generated synthetic data, and find that training synthesizers on data that are pre-processed via a multi-label undersampling method can promote more fair outcomes without degrading accuracy.

研究の動機と目的

  • 微分プライバシー合成データが下流の機械学習タスクにおける公平性に与える影響を調査すること。
  • DP合成器が特にマイノリティグループに対して、クラス不均衡を悪化させるかどうかを特定すること。
  • 非プライベートデータをマルチラベルアンダーサンプリングで前処理することで、DP合成データにおける公平性が向上するかどうかを評価すること。
  • 実世界のデータセットを用いて、複数のDP合成器の公平性と精度のパフォーマンスを比較すること。
  • どのDP合成器も非プライベートデータと同等の公平性と精度を維持しているかどうかを同定すること。

提案手法

  • QUAILエンsemblingを用いた有無を含め、4つのDP合成器(MWEM、DP-CTGAN、PATE-CTGAN、MST)を評価した。
  • 非プライベート学習データをバランスさせるために、マルチラベルアンダーサンプリングを前処理として適用した。
  • DP合成データ上でロジスティック回帰分類器を学習し、非プライベートベースラインと公平性と精度を比較した。
  • 公平性は等しいオッズ距離、精度はF1スコアを用い、データセット(ACS Income、Adult、COMPAS)全体で測定した。
  • ガウスメカニズムおよびDP-SGDを用いて微分プライバシーを適用し、制御されたプライバシー予算で(ε,δ)-微分プライバシーを確保した。
  • 合成データと元のデータにおけるマイノリティグループの割合を可視化・比較し、分布シフトと公平性結果の相関を分析した。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー合成データジェネレータは、下流のバイナリ分類タスクにおける公平性を損なうか?
  • RQ2合成データにおけるマイノリティグループの割合と、下流モデルの公平性の間に相関があるか?
  • RQ3非プライベートデータをマルチラベルアンダーサンプリングで前処理することで、DP合成データにおける公平性を向上させつつ精度を損なわないか?
  • RQ4どのDP合成器が非プライベートデータと同等の公平性と精度を維持しているか?
  • RQ5ハイパーパramータの感度およびモデルアーキテクチャは、DP合成データにおける公平性結果にどのように影響するか?

主な発見

  • QUAIL-MWEM、QUAIL-DPCTGAN、QUAIL-PATECTGANの3つのDP合成器は、合成データにおけるマイノリティグループの代表割合を著しく低下させ、結果として公平性の悪化を引き起こした。
  • ACS Incomeデータセットにおいて、これらの3つのモデルからの合成データで学習した分類器は、非プライベートデータで学習した場合と比較して、等しいオッズ距離がほぼ2倍にまで上昇した。
  • マルチラベルアンダーサンプリングによる前処理により、合成データにおけるマイノリティグループの割合が増加し、等しいオッズ距離が低下した。この結果、精度を損なわずに公平性が向上した。
  • MST合成器は、非プライベートデータとほぼ同一のマイノリティグループの割合を維持し、公平性と精度の指標が非プライベートベースラインと区別できない水準に達した。
  • QUAIL-DPCTGANおよびQUAIL-PATECTGANは、非常に変動が大きく、QUAILエンsemblingでさえもハイパーパramータに強く依存しており、高い感度を示した。
  • 公平性の向上が精度の損失を伴わず達成されたため、DP合成データにおいては一般的に想定される公平性と精度のトレードオフとは逆の結果となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。