Skip to main content
QUICK REVIEW

[论文解读] Fair Learning with Private Demographic Data

Hussein Mozannar, Mesrob I. Ohannessian|arXiv (Cornell University)|Feb 26, 2020
Privacy-Preserving Technologies in Data参考文献 31被引用 19
一句话总结

本文提出了一种使用局部差分隐私(LDP)的受保护人口统计属性来学习公平预测器的框架,可在不暴露敏感信息的情况下实现非歧视性模型。该方法引入了一种两步学习算法,通过反转隐私化属性的统计量,在温和条件下实现对预测误差和公平性的理论保证,从而在原始属性与隐私化属性之间实现非歧视性等价。

ABSTRACT

Sensitive attributes such as race are rarely available to learners in real world settings as their collection is often restricted by laws and regulations. We give a scheme that allows individuals to release their sensitive information privately while still allowing any downstream entity to learn non-discriminatory predictors. We show how to adapt non-discriminatory learners to work with privatized protected attributes giving theoretical guarantees on performance. Finally, we highlight how the methodology could apply to learning fair predictors in settings where protected attributes are only available for a subset of the data.

研究动机与目标

  • 解决在法律和隐私约束下,确保非歧视性机器学习与保护敏感人口统计数据之间的冲突。
  • 开发一种方法,使下游学习者仅能使用受保护属性的本地私有版本来训练公平预测器。
  • 建立理论条件,使得针对私有属性的公平性可推导出针对原始敏感属性的公平性。
  • 提供一种两步学习算法,即使受保护属性仅部分可用,也能在误差和歧视性方面提供统计保证。

提出的方法

  • 该方法使用本地差分隐私(LDP)对敏感属性进行隐私化处理,确保个体层面的隐私,同时保留用于公平学习的效用。
  • 引入估计器,仅使用隐私化属性 $ Z $ 来衡量歧视,实现无需访问原始 $ A $ 的公平性审计。
  • 核心算法通过反转 $ Z $ 的统计量来恢复原始 $ A $ 的属性,从而可从隐私化数据中构建非歧视性预测器。
  • 采用两步学习流程:首先在隐私化数据上训练基础预测器;其次优化派生预测器以最小化误差并强制执行公平性约束。
  • 理论分析基于经验过程理论和 Rademacher 复杂度,对误差和歧视性进行有高概率保证的界。
  • 该框架可扩展至受保护属性仅部分可用的数据场景,使用具有统计保证的审计算法。

实验结果

研究问题

  • RQ1在何种条件下,针对局部私有属性 $ Z $ 的非歧视性等价于针对原始敏感属性 $ A $ 的非歧视性?
  • RQ2我们能否设计一种学习算法,在仅能访问隐私化人口统计数据时,实现低误差和低歧视性,并具有理论保证?
  • RQ3隐私级别和假设类复杂度如何影响私有公平学习中的公平性与误差之间的权衡?
  • RQ4所提出的方法能否处理受保护属性缺失或仅在部分训练数据中可用的场景?
  • RQ5与最优公平预测器相比,派生预测器在误差和歧视性方面的统计性能如何?

主要发现

  • 本文建立了充分条件,使得针对私有属性 $ Z $ 的公平性可推出针对原始属性 $ A $ 的公平性,从而实现隐私保护下的公平性。
  • 派生预测器 $ \widetilde{Y} $ 的误差界为 $ \mathrm{err}(\widetilde{Y}) \leq_{\delta} \mathrm{err}(Y^{*}) + \frac{5C}{\min_{ya}\mathbf{P}_{ya}^{2}}\left(\frac{2}{B} + 10\mathfrak{R}_{\frac{\min_{ya}n\mathbf{P}_{ya}}{4}}(\mathcal{H}) + 18|\mathcal{A}|\sqrt{\frac{2\log{64|\mathcal{A}|/\delta}}{n\min_{ya}\mathbf{P}_{ya}}}\right) $,且以高概率成立。
  • 歧视性被界定为 $ \mathrm{disc}(\widetilde{Y}) \leq_{\delta} \sqrt{\frac{\log(64/\delta)}{2n}} \cdot \frac{8|\mathcal{A}|C^{2}}{\min_{ya}\mathbf{P}_{ya}^{2}} $,表明随着样本量增大和私有属性方差降低,公平性得以提升。
  • 该方法实现了 $ A $ 与 $ Z $ 之间的非歧视性等价,避免了基于代理变量的公平性方法可能低估偏见的问题。
  • 当受保护属性仅在部分数据中可用时,审计算法可对公平性提供统计保证,从而在缺乏完整的人口统计信息时仍能检测偏见。
  • 理论分析确认,两步算法在公平性和误差性能方面与最优公平预测器相当,其界取决于假设类的复杂度和数据分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。