Skip to main content
QUICK REVIEW

[论文解读] Differentially Private and Fair Deep Learning: A Lagrangian Dual Approach

Cuong Dinh Tran, Ferdinando Fioretto|arXiv (Cornell University)|Sep 26, 2020
Privacy-Preserving Technologies in Data被引用 9
一句话总结

该论文提出了一种私有且公平的拉格朗日对偶(PF-LD)框架,通过在训练深度神经网络时满足多种群体公平性标准(如人口均等、机会均等和准确率均等),同时确保敏感属性的差分隐私保护。通过应用拉格朗日对偶方法嵌入公平性约束,并在原始和对偶更新中注入经过校准的裁剪边界下的噪声,该方法在准确率、隐私和公平性之间实现了平衡的权衡,在基准数据集上的表现优于基线方法。

ABSTRACT

A critical concern in data-driven decision making is to build models whose outcomes do not discriminate against some demographic groups, including gender, ethnicity, or age. To ensure non-discrimination in learning tasks, knowledge of the sensitive attributes is essential, while, in practice, these attributes may not be available due to legal and ethical requirements. To address this challenge, this paper studies a model that protects the privacy of the individuals sensitive information while also allowing it to learn non-discriminatory predictors. The method relies on the notion of differential privacy and the use of Lagrangian duality to design neural networks that can accommodate fairness constraints while guaranteeing the privacy of sensitive attributes. The paper analyses the tension between accuracy, privacy, and fairness and the experimental evaluation illustrates the benefits of the proposed model on several prediction tasks.

研究动机与目标

  • 解决确保非歧视性模型结果与保护敏感属性(如种族或性别)隐私之间的矛盾。
  • 开发一种深度学习框架,强制实施多种群体公平性定义,且在推理阶段无需访问敏感属性。
  • 在训练过程中集成差分隐私,通过校准的噪声注入来保持模型准确率和公平性。
  • 处理敏感属性部分缺失或用户选择性披露的场景,使框架适用于实际部署。
  • 在带约束优化下,通过拉格朗日对偶理论与实证分析,研究准确率、隐私与公平性之间的权衡。

提出的方法

  • 将公平性约束学习问题形式化为带约束的优化任务,利用拉格朗日对偶方法将公平性约束转换为带增强拉格朗日项的对偶形式。
  • 对原始和对偶更新均应用裁剪:仅在原始步骤中对涉及敏感属性的梯度进行裁剪,以最小化准确率损失。
  • 在原始和对偶更新中注入噪声,其校准基于约束梯度的敏感度及其范数,以确保 $(\epsilon, \delta)$-差分隐私。
  • 通过最小化预期约束违反和梯度误差的上界,校准裁剪边界 $C_p$ 和 $C_d$,以平衡偏差与方差。
  • 将框架扩展至处理缺失的敏感属性,通过将缺失属性建模为缺失数据,实现在仅部分个体披露其属性时的训练。
  • 采用类似时刻会计(moment accountant)的分析方法,追踪训练步骤中的隐私损失,确保正式的差分隐私保证。

实验结果

研究问题

  • RQ1深度学习模型是否能在训练期间不访问敏感属性的情况下实现强公平性表现?
  • RQ2如何在保持模型准确率和公平性的前提下,有效对敏感属性实施差分隐私?
  • RQ3在带约束的深度学习中,准确率、公平性和隐私之间的最优权衡是什么?
  • RQ4原始和对偶梯度的裁剪边界如何影响私有公平学习中的偏差-方差权衡?
  • RQ5当敏感属性部分缺失或未被披露时,模型表现如何?

主要发现

  • PF-LD框架在准确率、隐私和公平性之间实现了有利的权衡,在Bank和Income数据集上优于基线方法。
  • 中间裁剪边界 $C_p$ 和 $C_d$ 取得最佳平衡:边界过小会导致信息损失过高和公平性违规,边界过大则增加方差并降低性能。
  • 在Bank数据集上,公平性违规在中间 $C_p$ 和 $C_d$ 值下最小化,同时保持了高模型准确率和低约束违规。
  • 当敏感属性部分缺失(如60%缺失)时,随着缺失程度降低,模型仍能实现更低的公平性违规和更优的准确率-公平性权衡。
  • 即使在高隐私预算($\epsilon = 1.0$)下,该框架仍能有效减少公平性违规,表明其在各种隐私配置下均具鲁棒性。
  • 实证结果表明,当梯度超过裁剪阈值时,模型在最优 $C_p$ 和 $C_d$ 设置下仍能保持低频次的约束违规。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。