Skip to main content
QUICK REVIEW

[论文解读] Fair Decision Making using Privacy-Protected Data

Satya Kuppam, Ryan McKenna|arXiv (Cornell University)|May 29, 2019
Privacy-Preserving Technologies in Data参考文献 25被引用 8
一句话总结

本文利用真实的美国人口普查数据,研究差分隐私对资源分配决策中公平性的影响,表明严格的隐私保护(ε值较低)可能对代表性不足的群体造成不成比例的损害。本文提出了公平感知的度量方法与应对措施,证明隐私机制引入的噪声会加剧结果差异,尤其在小规模群体或基于阈值的决策中。

ABSTRACT

Data collected about individuals is regularly used to make decisions that impact those same individuals. We consider settings where sensitive personal data is used to decide who will receive resources or benefits. While it is well known that there is a tradeoff between protecting privacy and the accuracy of decisions, we initiate a first-of-its-kind study into the impact of formally private mechanisms (based on differential privacy) on fair and equitable decision-making. We empirically investigate novel tradeoffs on two real-world decisions made using U.S. Census data (allocation of federal funds and assignment of voting rights benefits) as well as a classic apportionment problem. Our results show that if decisions are made using an $ε$-differentially private version of the data, under strict privacy constraints (smaller $ε$), the noise added to achieve privacy may disproportionately impact some groups over others. We propose novel measures of fairness in the context of randomized differentially private algorithms and identify a range of causes of outcome disparities.

研究动机与目标

  • 使用敏感的公共数据,研究差分隐私对现实世界资源分配决策中公平性的影响。
  • 识别隐私保护噪声对代表性不足或小规模群体造成的不成比例影响。
  • 为随机化、差分隐私算法开发特定的公平性度量指标。
  • 提出并评估可降低结果差异性、同时保持隐私保证的应对措施。
  • 评估常用隐私机制(如拉普拉斯机制)在实践中是否可能导致不公平结果。

提出的方法

  • 基于1971年印度各州人口数据,实证评估三种现实决策:联邦资金分配、投票权利益分配和议会席位分配。
  • 应用拉普拉斯机制,对不同ε值下的总人口数进行扰动,以模拟差分隐私发布。
  • 使用平均预期偏离配额和最大乘法差异等公平性度量指标,评估结果的公平性。
  • 将差分隐私数据下的结果与基线(真实)值以及一种随机化的非私有分配方法进行比较。
  • 提出并测试考虑私有数据中噪声的改进分配算法,以在不牺牲隐私保证的前提下提升公平性。
  • 分析差异性的成因,包括算法偏见、阈值条件和人口规模效应。

实验结果

研究问题

  • RQ1隐私损失预算ε的选择如何影响基于差分隐私数据的资源分配决策中的公平性?
  • RQ2差分隐私在多大程度上会引入或放大大规模与小规模群体在分配结果上的差异?
  • RQ3针对随机化、私有算法的公平性度量能否检测到传统误差度量所掩盖的差异?
  • RQ4在隐私保护决策系统中,结果差异性的根本原因是什么,例如阈值效应或噪声偏差?
  • RQ5改进的分配程序是否能够缓解不公平性,同时保持差分隐私的保证?

主要发现

  • 在某些ε值下(例如ε ≈ 1.4×10⁻⁶至3.8×10⁻⁴),拉普拉斯机制引入的噪声可降低对配额的平均预期偏离,从而在整体上改善分配的公平性。
  • 随着ε减小,各州之间的最大乘法差异增大,表明更严格的隐私保护会导致实际结果中更大的不平等。
  • 在ε = 1.4×10⁻⁵时,许多州对配额的预期偏离显著低于真实数据,尽管这一预期结果在现实中不可达。
  • 小规模群体更容易受到噪声的不成比例影响,导致更大的相对误差,并增加被代表不足的风险。
  • 在决策中存在阈值条件时(例如少数语言投票权),当私有数据跨越关键阈值时,差异性会被放大。
  • 如改进的分配程序等应对措施可减少不公平性,但受监管约束以及部分算法缺乏误差界支持而变得复杂。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。