Skip to main content
QUICK REVIEW

[论文解读] Slicing: A New Approach to Privacy Preserving Data Publishing

Tiancheng Li, Ninghui Li|ArXiv.org|Sep 12, 2009
Privacy-Preserving Technologies in Data参考文献 29被引用 8
一句话总结

本文提出了一种新颖的隐私保护数据匿名化技术——切片(slicing),该技术通过垂直划分(将高度相关的属性分组为列)和水平划分(将元组聚类为桶)来实现数据分区,保留列内属性的相关性,同时打破列间关联。切片在数据可用性方面优于泛化和桶化(bucketization),并能有效防止属性披露和成员身份披露,尤其在高维数据集中表现更优。

ABSTRACT

Several anonymization techniques, such as generalization and bucketization, have been designed for privacy preserving microdata publishing. Recent work has shown that generalization loses considerable amount of information, especially for high-dimensional data. Bucketization, on the other hand, does not prevent membership disclosure and does not apply for data that do not have a clear separation between quasi-identifying attributes and sensitive attributes. In this paper, we present a novel technique called slicing, which partitions the data both horizontally and vertically. We show that slicing preserves better data utility than generalization and can be used for membership disclosure protection. Another important advantage of slicing is that it can handle high-dimensional data. We show how slicing can be used for attribute disclosure protection and develop an efficient algorithm for computing the sliced data that obey the l-diversity requirement. Our workload experiments confirm that slicing preserves better utility than generalization and is more effective than bucketization in workloads involving the sensitive attribute. Our experiments also demonstrate that slicing can be used to prevent membership disclosure.

研究动机与目标

  • 为解决泛化和桶化在高维微观数据中保护数据可用性和防止隐私泄露方面的局限性。
  • 开发一种技术,保留相关属性组内的属性相关性,同时破坏无关属性之间的关联,以降低重新识别风险。
  • 提供一种解决方案,同时防范属性披露(通过ℓ-多样性)和成员身份披露,而现有方法未能全面应对。
  • 通过保留有意义的相关性并最小化信息损失,实现对匿名化数据的有效分析。
  • 证明在真实工作负载中,切片在数据可用性方面优于泛化,在隐私保护方面优于桶化。

提出的方法

  • 垂直划分根据属性之间的相关性强弱将属性分组为列,确保高度相关的属性被保留在一起,以维持数据可用性。
  • 水平划分将元组聚类为桶,每个桶包含具有相似QI值的一组元组,从而实现类似k-匿名的保护。
  • 在每个桶内,对每列中的值进行随机置换,以打破列之间的关联,降低属性披露和成员身份披露的风险。
  • 通过确保每个桶中至少包含ℓ个不同的敏感属性值来强制实现ℓ-多样性,防止属性披露。
  • 设计了一种高效算法,计算满足ℓ-多样性要求的切片数据,同时最小化信息损失。
  • 该方法避免了泛化中的均匀分布假设,并在桶级别保留了跨属性的相关性,而桶化则不具备这一特性。

实验结果

研究问题

  • RQ1是否存在一种数据匿名化技术,能够在高维数据集中比泛化保留更高数据可用性的同时防止属性披露?
  • RQ2切片是否能有效防止成员身份披露?这一漏洞在桶化中存在。
  • RQ3在涉及敏感属性的真实工作负载中,切片与泛化和桶化相比,在数据可用性和隐私保护方面表现如何?
  • RQ4切片能否保持准标识符与敏感属性之间的属性相关性?这一相关性在桶化中会丢失。
  • RQ5当允许重叠切片(即一个属性出现在多个列中)时,隐私与可用性之间的权衡如何?

主要发现

  • 由于列内属性相关性的保留,切片在高维数据集中显著优于泛化,保持了更高的数据可用性。
  • 在涉及敏感属性的工作负载中,切片优于桶化,因为它保持了准标识符与敏感属性之间的相关性。
  • 切片能有效防止成员身份披露,而桶化则因发布原始QI值而易受此类攻击。
  • 实验结果证实,切片在数据可用性方面优于泛化,在保护敏感属性工作负载的隐私方面也优于桶化。
  • 切片中的随机元组分组在成员身份披露防护方面效果较差,表明未来工作需设计更智能的分桶算法。
  • 切片可扩展至重叠切片(即属性出现在多个列中),可能在牺牲部分隐私分析复杂度的前提下提升可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。