[论文解读] Attribute Privacy: Framework and Mechanisms
本文提出了一种新的隐私范式——属性隐私,其重点在于保护数据集的全局属性(如分布参数或汇总统计量),而非单个记录。该文基于Pufferfish框架形式化定义了数据集属性隐私与分布属性隐私,提出了一类基于Wasserstein距离的高效机制,通过添加与条件分布之间最坏情况Wasserstein距离成比例的噪声来实现隐私保护,并证明这些机制在保持高实用性的同时提供了强大的隐私保障,在某些情况下优于群体差分隐私。
Ensuring the privacy of training data is a growing concern since many machine learning models are trained on confidential and potentially sensitive data. Much attention has been devoted to methods for protecting individual privacy during analyses of large datasets. However in many settings, global properties of the dataset may also be sensitive (e.g., mortality rate in a hospital rather than presence of a particular patient in the dataset). In this work, we depart from individual privacy to initiate the study of attribute privacy, where a data owner is concerned about revealing sensitive properties of a whole dataset during analysis. We propose definitions to capture \emph{attribute privacy} in two relevant cases where global attributes may need to be protected: (1) properties of a specific dataset and (2) parameters of the underlying distribution from which dataset is sampled. We also provide two efficient mechanisms and one inefficient mechanism that satisfy attribute privacy for these settings. We base our results on a novel use of the Pufferfish framework to account for correlations across attributes in the data, thus addressing "the challenging problem of developing Pufferfish instantiations and algorithms for general aggregate secrets" that was left open by \cite{kifer2014pufferfish}.
研究动机与目标
- 为解决对数据集全局属性(如分布参数或汇总统计量)的隐私保护空白问题,这些属性即使在个体数据受保护的情况下仍可能敏感。
- 形式化定义两种不同的隐私概念:数据集属性隐私(保护样本级属性)与分布属性隐私(保护底层分布参数)
- 开发实用机制,确保在这些定义下的属性隐私,尤其在属性相关性存在的情况下
- 克服在一般汇总秘密下实例化Pufferfish框架的挑战,特别是当秘密依赖于记录间相关属性时
提出的方法
- 使用Pufferfish框架定义属性隐私,将秘密表示为数据集中所有属性值上的函数,或表示为分布参数
- 对于数据集属性隐私,将秘密定义为敏感属性在记录上求和取特定值的事件,并通过参数化分布族Θ建模不确定性
- 对于分布属性隐私,将底层分布参数(如伯努利成功概率)视为秘密,并考虑在不同参数值下输出函数的条件分布
- 采用不同秘密值下输出函数条件概率分布之间的Wasserstein距离作为隐私度量,确保对最坏情况参数配置的鲁棒性
- 提出一种Wasserstein机制,通过将Laplace噪声按最坏情况条件下分布间Wasserstein距离进行缩放,提供隐私保障
- 证明该机制可通过利用属性相关性的结构及输出的实际敏感度,实现比群体差分隐私更高的实用性
实验结果
研究问题
- RQ1我们如何正式定义数据集全局属性(如敏感属性的分布或其汇总统计量)的隐私?
- RQ2属性相关性对设计数据集级秘密的隐私机制有何影响?
- RQ3我们能否开发出高效机制,在保护分布参数(如伯努利概率)的同时保持高实用性?
- RQ4在Pufferfish框架中,条件输出分布之间的最坏情况Wasserstein距离与隐私保障有何关系?
- RQ5我们能否在确保全局属性强隐私的前提下,实现比现有机制(如群体差分隐私)更高的实用性?
主要发现
- 当最坏情况条件下分布之间的Wasserstein距离为1时,Wasserstein机制向输出函数添加Lap(1/ε)噪声,确保在数据集和分布两种设定下均满足属性隐私
- 在四个二值属性且条件概率有界(0.4 ≤ p₁, p₂ ≤ 0.6)的设定下,最坏情况Wasserstein距离为1,因此最优噪声添加为Lap(1/ε)
- 当参数空间Θ扩大时(如0.3 ≤ p₁, p₂ ≤ 0.7),最坏情况距离增至2,需添加Lap(2/ε)噪声,表明对模型不确定性的敏感性
- 对于分布属性隐私,当真实参数φ₂在0.2至0.8之间变化且φ₁ = 0.6 − 0.2φ₂时,最坏情况Wasserstein距离再次为1,从而支持使用Lap(1/ε)噪声实现隐私保护
- 所提机制在实用性上优于群体差分隐私,后者在相同设定下需添加Lap(4/ε)噪声,因其对敏感度的估计不够精确
- 该框架成功应对了Pufferfish框架在汇总秘密下实例化的挑战,通过将秘密建模为所有记录上的函数,并利用最坏情况分布敏感度
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。