Skip to main content
QUICK REVIEW

[論文レビュー] Private Post-GAN Boosting

Marcel Neunhoeffer, Zhiwei Steven Wu|arXiv (Cornell University)|Jul 23, 2020
Privacy-Preserving Technologies in Data参考文献 36被引用数 11
ひとこと要約

本稿では、Private Post-GAN Boosting (Private PGB) を提案する。これは、Private Multiplicative Weights アルゴリズムを用いて、複数のジェネレータが複数の訓練エポックにわたって生成したサンプルをプライバシー保護的に再重み付けすることで、合成データの品質を向上させる微分プライバシー手法である。MNIST、US Census、Titanic データセットにおいて、最先端の性能を達成し、全変動距離を 0.13 まで低下させ、標準的なプライベート GAN よりも機械学習モデルの性能を向上させた。

ABSTRACT

Differentially private GANs have proven to be a promising approach for generating realistic synthetic data without compromising the privacy of individuals. Due to the privacy-protective noise introduced in the training, the convergence of GANs becomes even more elusive, which often leads to poor utility in the output generator at the end of training. We propose Private post-GAN boosting (Private PGB), a differentially private method that combines samples produced by the sequence of generators obtained during GAN training to create a high-quality synthetic dataset. To that end, our method leverages the Private Multiplicative Weights method (Hardt and Rothblum, 2010) to reweight generated samples. We evaluate Private PGB on two dimensional toy data, MNIST images, US Census data and a standard machine learning prediction task. Our experiments show that Private PGB improves upon a standard private GAN approach across a collection of quality measures. We also provide a non-private variant of PGB that improves the data quality of standard GAN training.

研究の動機と目的

  • 訓練の不安定さやノイズによる収束問題により、微分プライバシー GAN の性能が低いという問題に対処すること。
  • GAN 訓練プロセスを変更せずに、後処理による方法で合成データ品質を向上させること。
  • 原理的で微分プライバシー的な再重み付けスキームを用いて、高品質かつプライバシー保護された合成データ生成を可能にすること。
  • 複数のジェネレータ出力の混合分布が、最終的なジェネレータモデルを上回ることを示すこと。
  • 標準 GAN 訓練のユーティリティを向上させる非プライベートなバージョンを提供すること。

提案手法

  • 合成データが不変であることをモデル化する目的のために、合成データプレーヤーと識別者プレーヤーの間の2人零和ゲームを定式化する。
  • プライベートな混合分布を、異なる訓練エポックから生成されたサンプルの間で、Private Multiplicative Weights (PMW) アルゴリズムを用いてプライバシー保護的に計算する。
  • プライベートに生成されたサンプルにのみサポートを制限することで、計算複雑性を低減し、高次元データへもスケーラブルであるようにする。
  • 識別者の均衡戦略を用いたリジェクトサンプリングステップを導入することで、追加のプライバシーコストなしにサンプル品質をさらに向上させる。
  • 微分プライバシーの後処理不変性を活用し、PMW ステップ後に安全にリジェクトサンプリングを適用する。
  • 同じ再重み付けおよびリジェクトサンプリングフレームワークを用いて、標準 GAN の性能を向上させる非プライベートなバージョンにこの手法を拡張する。

実験結果

リサーチクエスチョン

  • RQ1異なる訓練エポックからのジェネレータの混合は、プライベート GAN における最終ジェネレータと比較して、合成データの品質を向上させることができるか?
  • RQ2微分プライバシー的な再重み付け機構は、プライバシーを保持したままより高いユーティリティを達成できるか?
  • RQ3識別者の均衡戦略をリジェクトサンプリングに用いることで、プライバシーを損なわずサンプル品質を向上させることができるか?
  • RQ4提案手法は、US Census や MNIST のような実世界のデータセットにおいて、一般および特定のユーティリティ指標を向上させることができるか?
  • RQ5この手法の非プライベート版は、標準 GAN 訓練の性能を向上させるか?

主な発見

  • Private PGB は、1940 年 US Census の合成データにおける人種分布の全変動距離を、最終ジェネレータの 0.58 から 0.22 まで低下させ、忠実度が著しく向上した。
  • 追加のリジェクトサンプリング (PGB+DRS) を施した場合、全変動距離はさらに 0.13 まで低下し、周辺分布における強力な性能を示した。
  • 1940 年 Census データセットでは、PGB が最高の一般ユーティリティスコア (pMSE 比率 2.253) を達成し、DP GAN (2.357) や DP DRS (2.313) を上回った。
  • Titanic データセットでは、PGB が生成した合成データで訓練されたモデルが、標準的なプライベート GAN や DRS の出力で訓練されたモデルよりも、より高い精度、AUC、PR AUC を達成した。
  • PGB の非プライベート版は、MNIST における GAN の性能を向上させ、最終ジェネレータ単体よりも高品質な画像を生成した。
  • 本手法は、すべての評価対象データセットにおいて、回帰 RMSE や統計的距離といった複数の品質指標において一貫して性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。