[论文解读] Mitigating Statistical Bias within Differentially Private Synthetic Data
本文提出了一种基于差分隐私(DP)似然比的后处理重加权策略,以缓解在差分隐私约束下生成的合成数据中引入的统计偏差。通过引入无偏DP重要性加权、调整DP-SGD以估计权重,并利用判别器输出作为无隐私成本的权重,该方法在无需额外隐私成本的前提下,显著提升了各类频率学派与贝叶斯推断任务中下游模型的性能。
Increasing interest in privacy-preserving machine learning has led to new and evolved approaches for generating private synthetic data from undisclosed real data. However, mechanisms of privacy preservation can significantly reduce the utility of synthetic data, which in turn impacts downstream tasks such as learning predictive models or inference. We propose several re-weighting strategies using privatised likelihood ratios that not only mitigate statistical bias of downstream estimators but also have general applicability to differentially private generative models. Through large-scale empirical evaluation, we show that private importance weighting provides simple and effective privacy-compliant augmentation for general applications of synthetic data.
研究动机与目标
- 解决在差分隐私合成数据上训练的下游估计器中引入的统计偏差问题。
- 开发适用于各种DP生成模型的通用后处理技术,避免针对特定方法的调优。
- 在保持差分隐私的同时,提升合成数据在统计推断与模型训练中的实用性。
- 通过确保无偏推断而不损害隐私,使对发布合成数据的严格统计分析成为可能。
提出的方法
- 提出了一种新型无偏DP重要性加权扩展,其方差相比现有方法更低。
- 通过修改采样概率与噪声注入方式,对DP-SGD进行适配,以训练基于神经网络的分类器,从真实数据与合成数据中估计重要性权重。
- 利用DP-GAN的判别器输出作为重要性权重,避免消耗额外的隐私预算。
- 提出一个框架,使用相同的重加权方法对频率学派与贝叶斯推断进行去偏。
- 采用私有似然比估计,在(ϵ, δ)-差分隐私约束下计算重要性权重。
- 应用后处理定理,确保对合成数据的所有下游分析均保持差分隐私。
实验结果
研究问题
- RQ1后处理重加权策略是否能有效降低在差分隐私合成数据上训练的估计器中的统计偏差?
- RQ2如何在最小化方差并保持实用性的前提下,私有地估计重要性权重?
- RQ3DP-GAN的判别器输出能否作为有效且无隐私成本的重要性权重,用于下游推断?
- RQ4私有重要性加权在诸如分类与回归等多样化下游任务中,能在多大程度上提升模型性能?
- RQ5所提出的框架是否能泛化至不同的DP生成模型与数据类型?
主要发现
- 所提出的无偏DP重要性加权方法相比现有方法,显著降低了偏差与方差,提升了下游模型性能。
- 私有重要性加权显著增强了合成数据的实用性,某些设置下AUC得分最高提升0.13(例如,在乳腺癌数据中,校准PSIS下AUC从0.4417提升至0.5985)。
- 利用判别器输出作为重要性权重,在不消耗额外隐私预算的前提下实现了高性能(例如,在垃圾邮件数据中AUC达0.5997)。
- DP-MLP方法在估计权重方面表现优异,在信用数据中,当ϵ=6, δ=1e−5时,WST值降至0.0003。
- 实证结果表明,私有重要性加权在多个数据集(乳腺癌、垃圾邮件、信用)与模型(SVM、RF、MLP)上均一致提升了模型实用性。
- 该方法使对合成数据的有效统计推断成为可能,包括通过非参数自助法进行置信区间估计,即使原始模型无对应的DP版本亦可实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。