Skip to main content
QUICK REVIEW

[论文解读] ($k$,$\epsilon$)-Anonymity: $k$-Anonymity with $\epsilon$-Differential Privacy

Naoise Holohan, Spiros Antonatos|arXiv (Cornell University)|Oct 4, 2017
Privacy-Preserving Technologies in Data参考文献 21被引用 12
一句话总结

本文提出了 (k,ϵ)-匿名性,一种统一框架,将 k-匿名性与 ϵ-差分隐私相结合,以增强数据集中的隐私保护。通过仅对部分准标识符应用 k-匿名性,对剩余部分应用 ϵ-差分隐私,该方法减少了信息损失并缓解了维度灾难问题,即使在 k 和 ϵ 值适中时,记录抑制率也低于 5%,链接风险也低于 5%。

ABSTRACT

The explosion in volume and variety of data offers enormous potential for research and commercial use. Increased availability of personal data is of particular interest in enabling highly customised services tuned to individual needs. Preserving the privacy of individuals against reidentification attacks in this fast-moving ecosystem poses significant challenges for a one-size fits all approach to anonymisation. In this paper we present ($k$,$\epsilon$)-anonymisation, an approach that combines the $k$-anonymisation and $\epsilon$-differential privacy models into a single coherent framework, providing privacy guarantees at least as strong as those offered by the individual models. Linking risks of less than 5\% are observed in experimental results, even with modest values of $k$ and $\epsilon$. Our approach is shown to address well-known limitations of $k$-anonymity and $\epsilon$-differential privacy and is validated in an extensive experimental campaign using openly available datasets.

研究动机与目标

  • 解决 k-匿名性存在的局限性,例如维度灾难问题,以及差分隐私导致的高信息损失。
  • 开发一种统一的隐私模型,整合 k-匿名性与 ϵ-差分隐私的优势。
  • 通过利用 k-匿名性聚类结构,最小化差分隐私中的噪声注入,从而减少信息损失。
  • 使用记录链接风险和抑制率评估框架的隐私保障能力。
  • 在真实世界数据集上展示组合模型的可行性和可控性。

提出的方法

  • 仅对选定的准标识符子集应用 k-匿名性,以形成等价类。
  • 通过向剩余准标识符添加校准噪声,对它们应用 ϵ-差分隐私,以保护个体记录。
  • 采用基于置信度的 k-匿名性,确保每条记录以高概率(≥99%)与至少 k−1 条其他记录不可区分。
  • 引入抑制预算以限制被抑制记录的数量,最大值为 5%。
  • 利用 k-匿名性获得的聚类结构,降低需要应用差分隐私的维度空间。
  • 以 OLA 和 Mondrian 算法作为基础 k-匿名性方法,然后将其扩展以对剩余属性应用 ϵ-差分隐私。

实验结果

研究问题

  • RQ1k-匿名性与 ϵ-差分隐私能否被有意义地整合为一个统一且连贯的隐私框架?
  • RQ2将两种模型结合使用,是否相比单独使用任一模型能更有效地减少信息损失?
  • RQ3该框架在多大程度上能限制重识别风险,同时保持数据可用性?
  • RQ4在不同数据集上,抑制率如何随 k 和 ϵ 值的变化而变化?
  • RQ5该混合模型是否能缓解 k-匿名性中的维度灾难问题,并减少差分隐私中的噪声?

主要发现

  • (k,ϵ)-匿名性框架在所有评估的数据集中均实现了低于 5% 的记录抑制率,即使在严格的 99% 置信度 k-匿名性要求下也成立。
  • 在所有实验中,链接风险始终低于 5%,表明对重识别攻击具有强抵抗力。
  • 对于基于 OLA 的匿名化,(k,ϵ)-匿名性相比仅使用 k-匿名性,性能提升了 14 至 32 倍,原因是格点探索空间显著减小。
  • Mondrian 算法由于需额外循环以应用噪声,运行时间有所增加,但小 ϵ 值下抑制率仍保持在 5% 以下。
  • 该模型有效降低了准标识符空间的维度,从而减少了差分隐私组件所需的噪声量。
  • 即使在 k 和 ϵ 值适中的情况下,该框架仍能维持强大的隐私保障,显示出在真实世界部署中的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。