Skip to main content
QUICK REVIEW

[论文解读] PEARL: Data Synthesis via Private Embeddings and Adversarial Reconstruction Learning

Seng Pei Liew, Tsubasa Takahashi|arXiv (Cornell University)|Jun 8, 2021
Privacy-Preserving Technologies in Data参考文献 46被引用 5
一句话总结

PEARL 提出了一种基于私有嵌入和对抗性重建学习的差分隐私数据合成框架,可在不损失隐私预算的情况下实现无限次训练迭代。通过利用特征函数表示和隐私保护判别器,PEARL 在实际隐私水平(ε ≈ 1)下生成了高质量的合成数据,在图像和表格基准测试中均优于梯度裁剪和 DP-MERF 方法。

ABSTRACT

We propose a new framework of synthesizing data using deep generative models in a differentially private manner. Within our framework, sensitive data are sanitized with rigorous privacy guarantees in a one-shot fashion, such that training deep generative models is possible without re-using the original data. Hence, no extra privacy costs or model constraints are incurred, in contrast to popular approaches such as Differentially Private Stochastic Gradient Descent (DP-SGD), which, among other issues, causes degradation in privacy guarantees as the training iteration increases. We demonstrate a realization of our framework by making use of the characteristic function and an adversarial re-weighting objective, which are of independent interest as well. Our proposal has theoretical guarantees of performance, and empirical evaluations on multiple datasets show that our approach outperforms other methods at reasonable levels of privacy.

研究动机与目标

  • 为解决深度生成模型中梯度裁剪方法在训练迭代过程中隐私性能下降的问题。
  • 克服 DP-MERF 中固定表示的限制,该限制限制了模型的泛化能力和学习容量。
  • 开发一种框架,实现无迭代隐私成本的私有数据合成,并具备强大的重建能力。
  • 在具有实际意义的隐私水平(ε ≈ 1)下实现高质量的合成数据,而现有方法在此水平下失效。
  • 引入一种隐私保护判别器,通过优化采样策略来提升性能,且不消耗额外隐私预算。

提出的方法

  • 利用数据的特征函数(CF)构建私有嵌入,并通过差分隐私进行裁剪以保护敏感信息。
  • 引入极小极大优化目标,以最小化真实(已裁剪)数据与生成数据在特征函数空间中的差异。
  • 目标函数定义为:min_θ max_ω ∑(i=1 to k) [ω(t_i)/ω₀(t_i)] |Φ̃_Pr(t_i) - Φ̂_Qθ(t_i)|²,实现无需重新访问原始数据的对抗性训练。
  • 隐私保护判别器通过重新加权采样频率来优化嵌入表示,避免额外的隐私成本。
  • 该框架将数据裁剪与模型训练解耦,支持在固定隐私预算下进行无限次训练迭代。
  • 该方法采用频率的随机采样进行特征函数投影,判别器指导最优采样分布的选择。

实验结果

研究问题

  • RQ1是否可以训练一个深度生成模型,实现无迭代隐私成本下降的私有化?
  • RQ2基于特征函数的私有嵌入是否能够以差分隐私方式实现高保真度的数据重建?
  • RQ3隐私保护判别器是否通过优化采样策略,在不消耗额外隐私预算的情况下提升合成数据质量?
  • RQ4PEARL 是否能够在 ε ≈ 1 的水平下生成高质量的合成数据,而现有方法在此水平下失效?
  • RQ5在 FID、KID 和下游任务性能方面,PEARL 与梯度裁剪和 DP-MERF 相比表现如何?

主要发现

  • 在 ε = 1 时,PEARL 在 FID 和 KID 指标上优于 DP-MERF 和梯度裁剪模型(如 DPGAN、DPCGAN),FID 改进最高达 20%。
  • 引入隐私保护判别器带来了显著的性能提升,相比无判别器的 PEARL,FID 降低了 15%。
  • 在 (ε, δ) = (1, 10⁻⁵) 的 Adult 数据集上,PEARL 的平均 AUC(0.721 ± 0.035)和 AUPRC(0.618 ± 0.033)更接近真实数据(AUC:0.765,AUPRC:0.654),优于 DP-MERF。
  • 直方图显示,与 DP-MERF 相比,PEARL 更好地捕捉了数据模式和趋势(如“年龄”和分类特征)。
  • 理论分析证实了连续性、可微性和弱拓扑收敛性,支持训练的稳定性。
  • 隐私保护采样策略在渐近意义上保持一致,确保长期稳定性且不损失隐私预算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。