Skip to main content
QUICK REVIEW

[论文解读] On the Privacy Risks of Algorithmic Fairness

Hongyan Chang, Reza Shokri|arXiv (Cornell University)|Nov 7, 2020
Privacy-Preserving Technologies in Data参考文献 46被引用 6
一句话总结

本文研究了机器学习中群体公平性引入的隐私风险,表明公平性约束会通过成员身份推断攻击加剧信息泄露,尤其是对弱势子群体的影响。通过采用等效奇偶性(equalized odds)训练模型,研究揭示了一个权衡:公平性会增强对代表性不足群体的记忆化,从而提高其隐私风险,尽管初衷是减少偏见。

ABSTRACT

Algorithmic fairness and privacy are essential pillars of trustworthy machine learning. Fair machine learning aims at minimizing discrimination against protected groups by, for example, imposing a constraint on models to equalize their behavior across different groups. This can subsequently change the influence of training data points on the fair model, in a disproportionate way. We study how this can change the information leakage of the model about its training data. We analyze the privacy risks of group fairness (e.g., equalized odds) through the lens of membership inference attacks: inferring whether a data point is used for training a model. We show that fairness comes at the cost of privacy, and this cost is not distributed equally: the information leakage of fair models increases significantly on the unprivileged subgroups, which are the ones for whom we need fair learning. We show that the more biased the training data is, the higher the privacy cost of achieving fairness for the unprivileged subgroups will be. We provide comprehensive empirical analysis for general machine learning algorithms.

研究动机与目标

  • 调查在机器学习中强制实施群体公平性是否会增加训练数据的隐私风险。
  • 分析公平性约束如何影响关于个体的信息泄露,特别是对代表性不足或弱势子群体的影响。
  • 评估在强制实施公平性时,不同人口统计群体之间的隐私风险差异。
  • 开发并验证一种子群感知的成员身份推断攻击策略,以更准确捕捉公平模型中的隐私风险。
  • 展示公平性与隐私之间的权衡,尤其是在训练数据存在偏见的情况下。

提出的方法

  • 作者使用成员身份推断攻击作为模型信息泄露的代理指标,衡量攻击者判断某条数据是否属于训练集的能力。
  • 提出一种子群特定的成员身份推断攻击策略,即为每个受保护子群分别训练一个区分器,而非使用单一全局区分器。
  • 该方法在黑箱设置下评估隐私风险,仅可观察模型输出,不可访问内部参数或梯度。
  • 研究在多个数据集上比较了通过等效奇偶性强制实现的公平模型与无约束模型,包括合成数据、Law School、Bank Marketing 和 COMPAS 数据集。
  • 实证评估采用攻击准确率作为量化隐私风险的指标,并进行子群层面分析以检测差异。
  • 该框架应用于真实世界数据集,以验证研究发现不仅适用于合成环境,更关注数据偏见与模型公平性之间的相互作用。

实验结果

研究问题

  • RQ1在机器学习中强制实施群体公平性是否会增加对训练数据的成员身份推断攻击风险?
  • RQ2公平模型在不同受保护子群中的隐私风险有何差异,特别是对弱势群体?
  • RQ3训练集中数据偏见与实现公平性所付出的隐私成本之间存在何种关系?
  • RQ4子群特定的成员身份推断攻击是否能比全局区分器更有效地检测公平模型中的更高隐私风险?
  • RQ5公平性强制在多大程度上导致对代表性不足群体的记忆化,从而增加其隐私暴露?

主要发现

  • 由于对弱势子群训练数据的记忆化增强,公平模型在该群体中的隐私风险显著高于无约束模型。
  • 当底层训练数据偏见越严重时,公平性的隐私成本越高,表明公平性与隐私之间存在直接权衡。
  • 模型越公平(以等效奇偶性衡量),其对弱势子群造成的隐私风险就越大。
  • 子群特定的成员身份推断攻击比全局区分器获得更高的准确率,证明其在测量公平模型中隐私泄露方面更具有效性。
  • 即使平均隐私风险较低,弱势群体中的个体记录仍面临显著更高的暴露风险,尤其在小型或复杂子群中更为明显。
  • 本研究证实,公平性约束可能导致其本应保护的群体面临不成比例的隐私风险,从而损害伦理人工智能的目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。