[论文解读] Private Post-GAN Boosting
本文提出了一种差分隐私方法——私有后 GAN 提升(Private Post-GAN Boosting, Private PGB),通过在训练轮次中使用差分隐私的私有乘法权重算法(Private Multiplicative Weights algorithm),对来自多个生成器的样本进行重加权,从而提升合成数据的质量。该方法在 MNIST、美国人口普查和泰坦尼克号数据集上实现了最先进的性能,将总变差距离降低至 0.13,并在机器学习模型性能上优于标准的私有 GAN。
Differentially private GANs have proven to be a promising approach for generating realistic synthetic data without compromising the privacy of individuals. Due to the privacy-protective noise introduced in the training, the convergence of GANs becomes even more elusive, which often leads to poor utility in the output generator at the end of training. We propose Private post-GAN boosting (Private PGB), a differentially private method that combines samples produced by the sequence of generators obtained during GAN training to create a high-quality synthetic dataset. To that end, our method leverages the Private Multiplicative Weights method (Hardt and Rothblum, 2010) to reweight generated samples. We evaluate Private PGB on two dimensional toy data, MNIST images, US Census data and a standard machine learning prediction task. Our experiments show that Private PGB improves upon a standard private GAN approach across a collection of quality measures. We also provide a non-private variant of PGB that improves the data quality of standard GAN training.
研究动机与目标
- 解决由于训练不稳定和噪声引起的收敛问题,导致差分隐私 GAN 的性能低下。
- 开发一种后训练方法,以提升合成数据质量,而无需修改 GAN 训练过程。
- 通过一种系统性的差分隐私重加权方案,实现高质量、隐私保护的合成数据生成。
- 证明多个生成器输出的混合分布可优于最终的生成器模型。
- 提供一种非私有的变体,以提升标准 GAN 训练的实用性。
提出的方法
- 构建一个两玩家零和博弈模型,其中一名玩家为合成数据玩家,另一名为判别器玩家,以建模生成不可区分合成数据的目标。
- 应用私有乘法权重(Private Multiplicative Weights, PMW)算法,以差分隐私方式计算来自不同训练轮次的生成样本的近似最优混合分布。
- 通过仅将支持限制在私有生成的样本上,降低计算复杂度,使该方法可扩展至高维数据。
- 引入一种拒绝采样步骤,利用判别器的均衡策略作为拒绝采样器,进一步提升样本质量,且不增加额外的隐私成本。
- 利用差分隐私的后处理不变性,安全地在 PMW 步骤后应用拒绝采样。
- 将该方法扩展至非私有变体,使用相同的重加权和拒绝采样框架,以提升标准 GAN 的性能。
实验结果
研究问题
- RQ1与私有 GAN 中的最终生成器相比,来自不同训练轮次的多个生成器的混合是否能提升合成数据的质量?
- RQ2能否通过一种差分隐私的重加权机制,在保护隐私的同时实现更高的实用性?
- RQ3是否可以将判别器的均衡策略用作拒绝采样器,在不损害隐私的前提下提升样本质量?
- RQ4所提出的方法是否能在真实世界数据集(如美国人口普查和 MNIST)上提升通用和特定的实用性指标?
- RQ5该方法的非私有变体是否能提升标准 GAN 训练的性能?
主要发现
- 在 1940 年美国人口普查的合成数据中,Private PGB 将种族分布的总变差距离从 0.58(最终生成器)降低至 0.22,显著提升了数据保真度。
- 在额外应用拒绝采样(PGB+DRS)后,总变差距离进一步降低至 0.13,表明在边缘分布上表现优异。
- 在 1940 年人口普查数据集上,PGB 取得了最佳的通用实用性评分(pMSE 比值为 2.253),优于 DP GAN(2.357)和 DP DRS(2.313)。
- 在泰坦尼克号数据集上,使用 PGB 生成的合成数据训练的模型,其准确率、ROC AUC 和 PR AUC 均高于使用标准私有 GAN 或 DRS 输出训练的模型。
- PGB 的非私有变体在 MNIST 上提升了 GAN 性能,生成的图像质量优于仅使用最终生成器的结果。
- 该方法在所有评估数据集上,均一致地提升了多种质量度量指标,包括回归 RMSE 和统计距离。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。