[论文解读] Neither Private Nor Fair: Impact of Data Imbalance on Utility and Fairness in Differential Privacy
本文研究了数据不平衡与差分隐私(DP)在深度学习中联合导致模型效用与公平性下降的问题。通过在不平衡数据集上使用DP-SGD,作者发现即使数据不平衡程度较轻(例如少数群体占30%)以及隐私预算宽松(ε=4.98,ε=16.2),子群体之间的准确率差异仍增加5.1%–52%,且在不平衡与DP并存时,公平性度量指标(如人口均等性与机会均等性)显著恶化。
Deployment of deep learning in different fields and industries is growing day by day due to its performance, which relies on the availability of data and compute. Data is often crowd-sourced and contains sensitive information about its contributors, which leaks into models that are trained on it. To achieve rigorous privacy guarantees, differentially private training mechanisms are used. However, it has recently been shown that differential privacy can exacerbate existing biases in the data and have disparate impacts on the accuracy of different subgroups of data. In this paper, we aim to study these effects within differentially private deep learning. Specifically, we aim to study how different levels of imbalance in the data affect the accuracy and the fairness of the decisions made by the model, given different levels of privacy. We demonstrate that even small imbalances and loose privacy guarantees can cause disparate impacts.
研究动机与目标
- 研究数据不平衡与差分隐私在深度学习中对模型准确率与公平性联合影响的问题。
- 考察在宽松隐私保证(低ε)和轻微数据不平衡下,少数子群体是否仍遭受显著的非对称影响。
- 分析DP-SGD中的梯度裁剪如何在训练过程中加剧多数群体与少数群体之间的准确率差距。
- 在不同数据不平衡水平与隐私预算下,评估公平性度量指标——人口均等性与机会均等性。
- 识别在严格隐私保证下DP未能确保公平模型性能的条件。
提出的方法
- 在图像分类任务(CelebA、UTKFace)上对DP-SGD进行实证评估,控制数据不平衡水平(少数群体占比0.1%至30%)。
- 系统性地改变隐私预算ε(从1.15到16.2)和δ=10⁻⁶,以评估其对模型准确率与公平性的影响。
- 使用矩量会计方法全程追踪并强制执行隐私预算。
- 在整个训练过程中监控子群体准确率(如CelebA中女性与男性)的变化,以观察差异动态。
- 测量公平性度量指标:敏感子群体间的人口均等性差异(ΔDemP)与机会均等性差异(ΔEO)。
- 分析梯度裁剪的影响,假设由于少数群体样本在小批量中频率较低,其更可能被裁剪。
实验结果
研究问题
- RQ1在使用差分隐私深度学习时,数据不平衡如何影响子群体之间的准确率差异?
- RQ2DP对模型准确率的非对称影响是否在宽松隐私保证(如ε=4.98或ε=16.2)下依然存在?
- RQ3在DP下,随着数据不平衡程度增加,人口均等性与机会均等性等公平性度量如何变化?
- RQ4DP-SGD中的梯度裁剪在训练过程中在多大程度上加剧了多数群体与少数群体之间的准确率差距?
- RQ5高隐私预算(紧ε)能否缓解公平性下降?还是反而因严重降低效用而导致公平性改善?
主要发现
- 即使在相对平衡的数据集(少数群体占30%)下,使用ε=4.98或ε=16.2的DP-SGD,子群体之间的准确率差异仍分别增加5.1%和5.2%。
- 当少数群体减少至数据集的0.1%时,在ε=4.98和ε=16.2下,准确率差异分别上升至19%和52%。
- 随着数据不平衡程度增加,公平性度量显著恶化:ΔDemP与ΔEO在所有隐私水平下均变差,且在高度不平衡设置下恶化最为严重。
- 子群体准确率的差异主要由梯度裁剪引起,由于少数群体样本在小批量中频率较低,其更易被裁剪。
- 更紧的隐私预算(如ε=1.15)虽能减少准确率差异,但并非通过改善公平性,而是因严重降低整体效用,使模型预测趋于随机,从而在预测上更趋平衡。
- 本研究表明,DP并不能确保公平性,甚至在数据不平衡可忽略且隐私预算宽松的情况下,也可能加剧现有偏见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。