[论文解读] Robin Hood and Matthew Effects: Differential Privacy Has Disparate Impact on Synthetic Data
本文研究了在生成合成表格数据的生成模型中,差分隐私(DP)对代表性不足子群体的非对称影响。结果表明,DP 可能引发‘罗宾汉效应’(减少不平衡)或‘马太效应’(加剧不平衡),导致下游分类器的准确率下降不均,尤其在较高隐私预算和数据不平衡的情况下,少数类受影响更严重。
Generative models trained with Differential Privacy (DP) can be used to generate synthetic data while minimizing privacy risks. We analyze the impact of DP on these models vis-a-vis underrepresented classes/subgroups of data, specifically, studying: 1) the size of classes/subgroups in the synthetic data, and 2) the accuracy of classification tasks run on them. We also evaluate the effect of various levels of imbalance and privacy budgets. Our analysis uses three state-of-the-art DP models (PrivBayes, DP-WGAN, and PATE-GAN) and shows that DP yields opposite size distributions in the generated synthetic data. It affects the gap between the majority and minority classes/subgroups; in some cases by reducing it (a "Robin Hood" effect) and, in others, by increasing it (a "Matthew" effect). Either way, this leads to (similar) disparate impacts on the accuracy of classification tasks on the synthetic data, affecting disproportionately more the underrepresented subparts of the data. Consequently, when training models on synthetic data, one might incur the risk of treating different subpopulations unevenly, leading to unreliable or unfair conclusions.
研究动机与目标
- 分析差分隐私(DP)对 DP 生成模型所生成的合成表格数据中类别和子群体分布的影响。
- 探究在 DP 合成数据上训练分类器是否会导致与在真实数据上训练 DP 分类器时观察到的相同非对称准确率影响,特别是对代表性不足的子群体。
- 评估不同 DP 机制(拉普拉斯、DP-SGD、PATE)以及不同隐私预算和数据不平衡水平对合成数据公平性和可用性的影响。
- 识别 DP 生成模型产生具有偏差子群体表示的合成数据并导致少数群体下游性能下降的条件。
提出的方法
- 评估了三种最先进的 DP 生成模型:PrivBayes(拉普拉斯机制)、DP-WGAN(DP-SGD)和 PATE-GAN(私有教师集成聚合)。
- 在具有受控类别和子群体不平衡水平的表格数据集上训练每个模型,并在多个设置中调整隐私预算(epsilon)。
- 为每个模型和配置生成多个合成数据集,以计算置信区间并评估统计稳定性。
- 在合成数据上训练下游二分类和多分类分类器,并按类别和子群体测量准确率,以检测可用性差异。
- 比较真实数据与合成数据中子群体规模的分布,量化不平衡变化(如罗宾汉效应与马太效应)。
- 开展消融研究,以分离隐私预算、数据不平衡和模型架构对公平性和可用性指标的影响。
实验结果
研究问题
- RQ1RQ1:DP 生成模型是否生成反映真实数据分布的类别和子群体比例的合成数据?
- RQ2RQ2:在 DP 合成数据上训练分类器是否会导致与在真实数据上训练 DP 分类器时相同的非对称准确率影响?
- RQ3RQ3:不同 DP 机制(拉普拉斯、DP-SGD、PATE)以及不同隐私预算和数据不平衡水平如何影响合成数据的公平性和可用性?
主要发现
- DP 生成模型对子群体分布产生相反影响:PrivBayes 减少不平衡(罗宾汉效应),而 PATE-GAN 增加不平衡(马太效应)。
- 所有 DP 生成模型均导致下游分类器准确率的非对称下降,代表性不足的子群体性能下降更大且更不稳定。
- 随着隐私保证增强(epsilon 值降低),大小和准确率差异的幅度均增大,尤其在高度不平衡的数据集中更为显著。
- PATE-GAN 在多类别、高度不平衡数据中严重无法学习稀有子群体,并在低隐私预算下生成子群体与目标变量之间的虚假相关性。
- PATE-GAN 生成的合成数据上分类器的可用性通常与 DP-WGAN 相当或更优,但代价是子群体表示存在偏差且子群体层面的性能不可靠。
- 生成模型的选择、DP 机制和隐私预算对公平性结果有显著影响,表明在隐私保护的合成数据生成中不存在‘一刀切’的解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。