Skip to main content
QUICK REVIEW

[论文解读] An Uncertainty Principle is a Price of Privacy-Preserving Microdata

John M. Abowd, Robert Ashmead|arXiv (Cornell University)|Oct 25, 2021
Privacy-Preserving Technologies in Data参考文献 32被引用 4
一句话总结

本文在差分隐私中建立了一个不确定性原理,量化了在发布隐私保护微观数据时,聚合(求和)查询与子群体(点)查询之间固有的准确性权衡。它证明,即使在纯差分隐私、近似差分隐私或集中差分隐私下,要求输出微观数据也会导致误差界出现对数或多项式级别的退化——最多达 log²d 或 d² 因子,且该结论在 PUMS 数据集上得到了经验验证。

ABSTRACT

Privacy-protected microdata are often the desired output of a differentially private algorithm since microdata is familiar and convenient for downstream users. However, there is a statistical price for this kind of convenience. We show that an uncertainty principle governs the trade-off between accuracy for a population of interest ("sum query") vs. accuracy for its component sub-populations ("point queries"). Compared to differentially private query answering systems that are not required to produce microdata, accuracy can degrade by a logarithmic factor. For example, in the case of pure differential privacy, without the microdata requirement, one can provide noisy answers to the sum query and all point queries while guaranteeing that each answer has squared error $O(1/ε^2)$. With the microdata requirement, one must choose between allowing an additional $\log^2(d)$ factor ($d$ is the number of point queries) for some point queries or allowing an extra $O(d^2)$ factor for the sum query. We present lower bounds for pure, approximate, and concentrated differential privacy. We propose mitigation strategies and create a collection of benchmark datasets that can be used for public study of this problem.

研究动机与目标

  • 识别并形式化要求差分隐私算法输出微观数据而非仅输出噪声查询结果所带来的统计成本。
  • 证明该要求在总体层面的求和查询与子群体点查询的准确性之间引入了不可避免的权衡。
  • 在必须发布微观数据的前提下,建立纯差分隐私、近似差分隐私和集中差分隐私下误差退化的理论下界。
  • 通过在真实世界 PUMS 数据集上使用多种噪声机制进行实验,验证理论发现。
  • 提出缓解策略,并发布公开基准数据集以研究此权衡问题。

提出的方法

  • 使用每查询期望平方误差作为主要度量指标,将其与先前工作中使用的同步/异常值误差区分开来。
  • 定义一组 d 个互不相交的点查询以及一个聚合这些查询的求和查询,以模拟人口普查数据或选区重划等现实用例。
  • 推导出在必须发布微观数据的前提下,纯差分隐私、近似差分隐私和集中差分隐私下,求和查询与点查询的误差理论下界。
  • 使用 ρ = 0.005 的高斯机制生成隐私保护的微观数据,并比较多种算法(olsalg、nnlsalg、maxalg、seqalg、weightalg)的查询误差。
  • 创建一个公开的 PUMS 数据集基准套件,包含每种查询类型和算法的计算平方误差与标准差。
  • 分析原始噪声查询结果与从合成微观数据中推导出的查询结果之间的差异,以量化误差膨胀程度。

实验结果

研究问题

  • RQ1要求差分隐私算法生成微观数据而非仅输出噪声查询结果,其根本的准确性成本是什么?
  • RQ2在差分隐私下,要求发布微观数据如何影响求和查询与其中各点查询的误差界?
  • RQ3当必须发布微观数据时,能否为纯差分隐私、近似差分隐私和集中差分隐私下的误差退化建立理论下界?
  • RQ4与直接发布噪声查询相比,现实世界中的微观数据合成方法在多大程度上放大了误差?
  • RQ5有哪些缓解策略可以减少隐私保护微观数据中聚合查询与子群体查询准确性之间的误差权衡?

主要发现

  • 要求输出微观数据会导致误差界出现对数或多项式级别的退化:在纯差分隐私下,求和查询误差可能增加 O(d²) 倍,而点查询误差可能增加 log²d 倍。
  • 若无微观数据要求,每个查询(求和与点查询)均可实现 O(1/ε²) 的平方误差;但一旦要求输出微观数据,除非某一类查询承担更高的误差代价,否则该保证将不复存在。
  • 在 PUMS 数据集上的实证结果表明,微观数据合成导致的查询误差显著高于原始噪声测量值,平方误差范围从约 300 到超过 7,000,具体取决于查询和算法。
  • 使用 ρ = 0.005 的高斯机制生成的求和查询平方误差在 323.4 至 1,661.8 之间,标准差范围为 ±12.2 至 ±283.4,表明不同数据集和算法间存在显著的变异性。
  • 原始测量误差与从微观数据中推导出的查询误差之间的差异表明,微观数据合成引入了系统性的误差膨胀,尤其对点查询更为明显。
  • 本研究发布的基准数据集表明,误差膨胀并非随机,而是与查询结构和所用隐私机制密切相关,呈现出可预测的模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。