Skip to main content
QUICK REVIEW

[论文解读] The Boundary Between Privacy and Utility in Data Anonymization

Vibhor Rastogi, Dan Suciu|ArXiv.org|Dec 21, 2006
Privacy-Preserving Technologies in Data参考文献 11被引用 3
一句话总结

本文提出了一种新颖的匿名化框架,形式化了数据发布中隐私与效用之间的权衡。该框架提出了一种基于随机删除和插入的算法,实现了强隐私保护(通过 ǫ-不可区分性)和有意义的效用(通过 k-有意义性),并证明当元组的先验概率为 O(n/m) 时,可实现既实用又私密的匿名化;但当先验概率为 Ω(n/√m) 时则不可能实现。

ABSTRACT

We consider the privacy problem in data publishing: given a relation I containing sensitive information 'anonymize' it to obtain a view V such that, on one hand attackers cannot learn any sensitive information from V, and on the other hand legitimate users can use V to compute useful statistics on I. These are conflicting goals. We use a definition of privacy that is derived from existing ones in the literature, which relates the a priori probability of a given tuple t, Pr(t), with the a posteriori probability, Pr(t | V), and propose a novel and quite practical definition for utility. Our main result is the following. Denoting n the size of I and m the size of the domain from which I was drawn (i.e. n < m) then: when the a priori probability is Pr(t) = Omega(n/sqrt(m)) for some t, there exists no useful anonymization algorithm, while when Pr(t) = O(n/m) for all tuples t, then we give a concrete anonymization algorithm that is both private and useful. Our algorithm is quite different from the k-anonymization algorithm studied intensively in the literature, and is based on random deletions and insertions to I.

研究动机与目标

  • 形式化数据匿名化中隐私与效用之间的权衡。
  • 定义一种新的效用度量——k-有意义性,用于捕捉准确回答统计查询的能力。
  • 识别在理论上实现私密且有用的匿名化的条件,或不可能实现的条件。
  • 提出一种基于随机元组插入和删除的新匿名化算法,与 k-匿名性不同。
  • 基于元组的先验概率,建立匿名化可行性上的紧密理论边界。

提出的方法

  • 提出一种称为 k-有意义性的新效用定义,用于衡量两个在少量元组上不同的数据库实例之间查询结果的统计不可区分性。
  • 引入一种基于 ǫ-不可区分性的隐私定义,定义在集合 D′ 上,该定义放宽了标准 ǫ-不可区分性,以适应实际的攻击者模型。
  • 开发了一种新颖的匿名化算法,通过随机删除和插入元组来扰动数据,同时保持统计效用。
  • 使用分桶化假设来建模匿名化数据组的形成方式,确保匿名视图之间的结构一致性。
  • 使用查询结果分布之间的统计距离(SD)来量化效用损失和信息泄露。
  • 采用反证法的证明策略:表明若效用得以保持(即 k-有意义性成立),则在某些攻击者模型下,除非先验概率受到限制,否则隐私无法得到保障。

实验结果

研究问题

  • RQ1在何种条件下,理论上无法在数据匿名化中同时实现隐私与效用?
  • RQ2攻击者的背景知识——特别是元组的先验概率——如何影响匿名化的可行性?
  • RQ3一种新的匿名化方法是否能在保持强隐私保证的同时,优于 k-匿名性在效用方面的表现?
  • RQ4域大小(m)、数据库大小(n)与匿名化可行性之间的精确关系是什么?
  • RQ5简单的随机插入/删除机制是否能在正式定义下同时实现隐私与效用?

主要发现

  • 当某元组的先验概率为 Ω(n/√m) 时,任何匿名化算法都无法同时实现隐私与效用,从而确立了可行性的根本下界。
  • 当所有元组的先验概率为 O(n/m) 时,存在一种既私密又有用的匿名化算法,证明了可行性的紧上界。
  • 所提出的随机删除与插入算法在 O(n/m) 条件下同时实现了 ǫ-不可区分性与 k-有意义性,提供了一种实用的解决方案。
  • 在实验评估中,该算法使数据规模最多增加 10 倍,此增加被认定为可接受,以维持效用。
  • 本文证明,若先验概率超过 Ω(n/√m),则 k-有意义性算法(意味着有意义的效用)与 d-排他性攻击者下的隐私不相容。
  • 理论结果表明,先验概率的选择至关重要:若某些元组的先验概率过高,则无论采用何种匿名化方法,隐私均无法得到保障。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。