[论文解读] Individual Privacy vs Population Privacy: Learning to Attack Anonymization
本文表明,即使经过差分隐私保护的数据——被视为隐私保护的黄金标准——仍可用于训练分类器,以高准确率推断个体的私有属性。通过利用群体层面的统计模式,攻击者可实现高推理准确率,揭示了个体隐私与群体层面隐私保护之间的根本性矛盾。
Over the last decade there have been great strides made in developing techniques to compute functions privately. In particular, Differential Privacy gives strong promises about conclusions that can be drawn about an individual. In contrast, various syntactic methods for providing privacy (criteria such as kanonymity and l-diversity) have been criticized for still allowing private information of an individual to be inferred. In this report, we consider the ability of an attacker to use data meeting privacy definitions to build an accurate classifier. We demonstrate that even under Differential Privacy, such classifiers can be used to accurately infer "private" attributes in realistic data. We compare this to similar approaches for inferencebased attacks on other forms of anonymized data. We place these attacks on the same scale, and observe that the accuracy of inference of private attributes for Differentially Private data and l-diverse data can be quite similar.
研究动机与目标
- 调查差分隐私数据是否仍可用于以高准确率推断个体的私有属性。
- 比较差分隐私数据与语法匿名化方法(如 l-多样性)在推理攻击中的有效性。
- 突出个体隐私保障与群体层面推理攻击风险之间的脱节。
- 挑战差分隐私在实践中可完全保护个体隐私的假设。
- 强调需要在正式定义之外,采用更细致的隐私评估方法。
提出的方法
- 作者在差分隐私数据上训练机器学习分类器,基于准标识符(如年龄、性别、位置)预测敏感属性。
- 攻击使用直方图查询——对分组数据的计数查询——通过拉普拉斯或几何机制添加噪声以确保差分隐私。
- 每个查询的敏感度计算为单个个体对查询结果最大 L1 影响。
- 噪声独立地添加到每个计数查询中,使用根据敏感度和隐私预算 ϵ 推导出参数的拉普拉斯或对称几何分布。
- 随后在已知准标识符的个体上测试分类器,测量预测敏感值的准确率。
- 该方法与已知的 k-匿名和 l-多样性攻击进行比较,显示各类方法的推理准确率相似。
实验结果
研究问题
- RQ1能否在差分隐私数据上训练的分类器准确推断个体的私有属性?
- RQ2对差分隐私数据的推理攻击准确率与对 l-多样或 k-匿名化数据的攻击相比如何?
- RQ3匿名化数据中的群体统计特征在多大程度上损害了个体隐私?
- RQ4为何形式化的隐私定义(如差分隐私)无法防止概率推理攻击?
- RQ5此类攻击对数据共享和隐私政策的实际影响是什么?
主要发现
- 即使在差分隐私保护下,分类器仍能以非平凡的准确率推断私有属性,表明形式化隐私保证无法消除推理风险。
- 差分隐私数据的推理准确率与 l-多样性及其他语法匿名化方法相当,表明存在类似的漏洞。
- 该攻击通过利用群体统计特征之间的相关性而成功,而这些相关性即使在应用差分隐私后仍被保留。
- 该方法计算开销极低,仅需一轮非自适应查询,具有实际可行性和可扩展性。
- 结果揭示了个体隐私(由差分隐私保护)与群体隐私(通过统计推理暴露)之间的根本性矛盾。
- 本研究表明,差分隐私无法防止概率披露,即攻击者可在无绝对确定性的情况下,显著提高对个体私有数据的信念。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。