Skip to main content
QUICK REVIEW

[论文解读] Perturbed Gibbs Samplers for Synthetic Data Release

Yubin Park, Joydeep Ghosh|arXiv (Cornell University)|Dec 18, 2013
Privacy-Preserving Technologies in Data参考文献 21被引用 3
一句话总结

本文提出了一种用于高维分类数据的差分隐私合成数据生成器——扰动吉布斯采样器(PeGS),该方法结合特征哈希与非参数建模,在确保可量化的隐私保护的同时,有效保留了统计效用。PeGS 通过差分隐私与 l-多样性实现强隐私保障,并在加州患者出院数据集上进行了实证验证,显示其在边际分布、条件分布及基于回归的统计量方面畸变极小。

ABSTRACT

We propose a categorical data synthesizer with a quantifiable disclosure risk. Our algorithm, named Perturbed Gibbs Sampler, can handle high-dimensional categorical data that are often intractable to represent as contingency tables. The algorithm extends a multiple imputation strategy for fully synthetic data by utilizing feature hashing and non-parametric distribution approximations. California Patient Discharge data are used to demonstrate statistical properties of the proposed synthesizing methodology. Marginal and conditional distributions, as well as the coefficients of regression models built on the synthesized data are compared to those obtained from the original data. Intruder scenarios are simulated to evaluate disclosure risks of the synthesized data from multiple angles. Limitations and extensions of the proposed algorithm are also discussed.

研究动机与目标

  • 开发一种可扩展的高维分类数据合成数据生成器,其难以用列联表表示。
  • 通过正式的隐私保障(包括 ε-差分隐私与 l-多样性)确保可量化的披露风险。
  • 通过保留边际与条件分布及回归系数,维持合成数据的高统计效用。
  • 通过模拟攻击(包括人群唯一性与概率性披露风险)评估隐私风险。
  • 探索在严格隐私预算下,合成数据生成中隐私与效用之间的权衡。

提出的方法

  • 该方法采用基于非参数条件概率估计的块吉布斯采样框架,结合特征哈希以实现对高维数据的可扩展性。
  • 每个变量通过基于其余变量哈希键相同的行的非参数核密度近似进行条件插补。
  • 通过在条件概率上应用拉普拉斯噪声,实现 ε-差分隐私。
  • 该算法使用哈希方案将相似数据行分组,从而实现高效计算并减少对完整列联表的需求。
  • 该方法支持多重插补,使对合成数据集的稳健统计推断成为可能。
  • 通过 ε-差分隐私与 l-多样性进行正式的隐私分析,并通过人群唯一性与间接匹配概率进行额外风险评估。

实验结果

研究问题

  • RQ1合成数据生成器是否能在高维分类数据中维持与原始数据的统计保真度,同时确保正式的隐私保障?
  • RQ2特征哈希与非参数建模的使用如何影响合成数据生成的效用与可扩展性?
  • RQ3PeGS 中的扰动步骤相较于传统方法,在多大程度上降低了披露风险?
  • RQ4不同的隐私参数(ε)如何影响合成数据中效用与隐私之间的平衡?
  • RQ5所提出的方法在隐私与原始数据统计相似性方面是否优于现有技术?

主要发现

  • 扰动吉布斯采样器成功生成了与原始加州患者出院数据集相比畸变极小的合成数据,其边际与条件分布保持良好。
  • 在合成数据上估计的回归系数与原始数据中的结果高度一致,表明其具有强大的统计效用。
  • 该算法提高了人群唯一性,这是与 k-匿名或 l-多样性方法(后者会降低唯一性)的关键区别。
  • ε 值越低,分布比较中的绝对误差越高,支持将 ε 作为有意义的隐私-效用权衡度量。
  • 该方法在 ε-差分隐私与 l-多样性下实现了强隐私保障,模拟攻击显示记录重识别的成功率极低。
  • 哈希机制不仅提升了计算效率,还增强了隐私保护,但未来工作仍需对哈希机制进行更紧密的正式隐私分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。