[论文解读] ($k$,$ε$)-Anonymity: $k$-Anonymity with $ε$-Differential Privacy
本文提出了 (k,ε)-匿名性,这是一种统一框架,将 k-匿名性与 ε-差分隐私相结合,以增强数据集中的隐私保护。通过对选定的准标识符应用 k-匿名性,对其他准标识符应用 ε-差分隐私,该方法减少了信息损失和链接风险——即使在 k 和 ε 值适中时,记录抑制率也低于 5%,且性能和隐私保证优于单独使用任一方法。
The explosion in volume and variety of data offers enormous potential for research and commercial use. Increased availability of personal data is of particular interest in enabling highly customised services tuned to individual needs. Preserving the privacy of individuals against reidentification attacks in this fast-moving ecosystem poses significant challenges for a one-size fits all approach to anonymisation. In this paper we present ($k$,$ε$)-anonymisation, an approach that combines the $k$-anonymisation and $ε$-differential privacy models into a single coherent framework, providing privacy guarantees at least as strong as those offered by the individual models. Linking risks of less than 5\% are observed in experimental results, even with modest values of $k$ and $ε$. Our approach is shown to address well-known limitations of $k$-anonymity and $ε$-differential privacy and is validated in an extensive experimental campaign using openly available datasets.
研究动机与目标
- 解决单独使用 k-匿名性和 ε-差分隐私时的局限性,例如信息损失过高和维度灾难问题。
- 开发一种统一的隐私模型,将 k-匿名性的确定性不可区分性与 ε-差分隐私的随机不可区分性相结合。
- 通过利用 k-匿名性聚类来最小化差分隐私中的噪声注入,从而减少信息损失。
- 使用链接风险和基于置信度的 k-匿名性指标评估框架的隐私保证。
- 在真实世界数据集上通过受控的抑制率和性能开销对方法进行实验验证。
提出的方法
- 该框架对部分准标识符应用 k-匿名性,以创建等价类,确保每个组至少包含 k 条记录。
- 对剩余的准标识符,通过添加校准噪声来强制实施 ε-差分隐私,以保护个体记录。
- 该方法使用基于置信度的 k-匿名性来量化记录链接的风险,设定可接受重识别概率的阈值。
- 结合使用两种 k-匿名性算法——OLA 和 Mondrian——并配合差分隐私,以评估性能和抑制开销。
- 通过将部分属性视为 k-准标识符,其他属性视为 ε-准标识符,降低隐私保护空间的维度,从而最小化噪声注入。
- 仅在必要时应用抑制以满足最多 5% 的抑制预算,确保数据可用性得以保持。
实验结果
研究问题
- RQ1k-匿名性与 ε-差分隐私能否被有意义地整合为一个统一且连贯的隐私框架?
- RQ2将 k-匿名性与 ε-差分隐私结合使用,是否能相比单独使用任一方法显著减少信息损失?
- RQ3在强敌手模型下,(k,ε)-匿名性的链接风险是多少?能否保持在 5% 以下?
- RQ4该框架在不同数据集和算法下的抑制开销与计算效率表现如何?
- RQ5基于置信度的 k-匿名性能否有效应用于量化混合模型中的隐私保证?
主要发现
- 即使在 k 和 ε 值适中的情况下,链接风险仍低于 5%,表明具有强大的隐私保护能力。
- 当 ε 值低于 1.0 时,所有数据集的 99%-置信度 k-匿名性均可实现,且记录抑制率低于 2%,无论 k 取值如何。
- 使用 OLA 时,k-匿名性与基于置信度的要求所导致的总抑制率在小 ε 值下保持在 5% 以内,符合抑制预算。
- Mondrian 算法由于等价类较小,抑制率高于 OLA,但小 ε 值下抑制率仍低于 5%。
- (k,ε)-匿名性框架在 OLA 下实现 14 至 32 倍的性能加速,原因在于减少了格点探索空间;而 Mondrian 因额外的噪声应用循环,运行时间略有增加。
- 该模型成功降低了隐私保护空间的维度,从而减少了差分隐私中的噪声需求,提升了数据可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。