Skip to main content
QUICK REVIEW

[论文解读] Private Set Generation with Discriminative Information

Dingfan Chen, Raouf Kerkouche|arXiv (Cornell University)|Nov 7, 2022
Privacy-Preserving Technologies in Data被引用 14
一句话总结

本文提出了一种新颖的方法,通过直接优化少量合成样本以提升下游任务的实用性,而非训练复杂的生成模型,从而实现对高维数据的差分隐私生成。该方法利用下游任务中的判别信息,在 MNIST 和 Fashion-MNIST 上相比最先进私有生成模型实现了最高达 10% 的测试准确率提升,同时显著降低了内存和计算成本。

ABSTRACT

Differentially private data generation techniques have become a promising solution to the data privacy challenge -- it enables sharing of data while complying with rigorous privacy guarantees, which is essential for scientific progress in sensitive domains. Unfortunately, restricted by the inherent complexity of modeling high-dimensional distributions, existing private generative models are struggling with the utility of synthetic samples. In contrast to existing works that aim at fitting the complete data distribution, we directly optimize for a small set of samples that are representative of the distribution under the supervision of discriminative information from downstream tasks, which is generally an easier task and more suitable for private training. Our work provides an alternative view for differentially private generation of high-dimensional data and introduces a simple yet effective method that greatly improves the sample utility of state-of-the-art approaches.

研究动机与目标

  • 解决现有差分隐私生成模型在高维数据设置下实用性差的问题。
  • 通过聚焦于下游任务性能而非完整分布建模,提升私有数据生成的实用性。
  • 通过将知识提炼到少量代表性合成样本中,降低计算和内存开销。
  • 为在严格隐私约束下训练深度生成模型提供更有效的替代方案。
  • 证明直接优化有信息量的样本可优于复杂私有生成建模,在实际应用中表现更优。

提出的方法

  • 该方法直接优化少量合成样本,而非训练深度生成模型,从而在差分隐私约束下降低训练复杂度。
  • 利用下游神经网络(如卷积神经网络分类器)的判别信号,引导合成样本的优化以提升实用性。
  • 使用差分隐私随机梯度下降(DP-SGD)进行优化,以确保隐私保障。
  • 可选地使用预训练 DCGAN 的图像先验,以提升样本质量和泛化能力。
  • 该方法被形式化为一个端到端可微的优化问题,平衡隐私、实用性与样本代表性。
  • 在多种数据集(MNIST、Fashion-MNIST)上,针对不同的隐私预算和每类样本数设置进行了评估。

实验结果

研究问题

  • RQ1在高维数据上,直接优化合成样本是否能优于在差分隐私约束下训练深度生成模型?
  • RQ2将下游任务的判别反馈引入后,私有合成数据的实用性提升程度如何?
  • RQ3在隐私预算有限的情况下,不同每类合成样本数量下,该方法的可扩展性如何?
  • RQ4少量合成样本是否能实现与完整生成模型相当或更优的下游性能,同时降低内存和计算成本?
  • RQ5使用预训练图像先验是否能提升私有合成样本的质量和泛化能力?

主要发现

  • 在 (ε,δ) = (10,10⁻⁵) 的隐私预算下,仅使用每类 20 个样本,该方法在 MNIST 上实现了 95.6% 的测试准确率,在 Fashion-MNIST 上实现了 77.7% 的测试准确率,相比最先进私有生成模型在下游任务准确率上最高提升 10%。
  • 即使每类样本数量较少(如 1 个或 10 个),该方法仍能显著提升下游分类性能,展现出强大的样本效率。
  • 引入基于 DCGAN 的图像先验可进一步提升性能,在每类 10 个样本下,MNIST 上达到 88.2% 的准确率,Fashion-MNIST 上达到 70.2% 的准确率。
  • 该方法对样本复杂度的增加具有鲁棒性,在每类 50 个样本时仍能保持高性能,尽管在低隐私预算下收敛速度变慢。
  • 通过将数据知识提炼到紧凑的合成样本集合中,该方法显著降低了内存和计算成本,提升了实际部署的可行性。
  • 结果挑战了当前训练复杂私有生成模型的主流范式,表明结合任务反馈的直接样本优化在下游分析中更为有效和高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。