Skip to main content
QUICK REVIEW

[论文解读] Bounding, Concentrating, and Truncating: Unifying Privacy Loss Composition for Data Analytics

Mark Cesar, Ryan Rogers|arXiv (Cornell University)|Apr 15, 2020
Privacy-Preserving Technologies in Data参考文献 15被引用 4
一句话总结

本文通过在自适应和非自适应选择下整合纯差分隐私(DP)、有界范围(BR)和集中差分隐私(CDP)机制,统一了差分隐私的隐私损失组合边界。它提供了依赖于机制顺序的最优组合边界,并为私有 top-$k$ 查询引入了截断高斯噪声,显著提升了实用性,同时在混合工作负载下保持了紧密的隐私保障。

ABSTRACT

Differential privacy (DP) provides rigorous privacy guarantees on individual's data while also allowing for accurate statistics to be conducted on the overall, sensitive dataset. To design a private system, first private algorithms must be designed that can quantify the privacy loss of each outcome that is released. However, private algorithms that inject noise into the computation are not sufficient to ensure individuals' data is protected due to many noisy results ultimately concentrating to the true, non-privatized result. Hence there have been several works providing precise formulas for how the privacy loss accumulates over multiple interactions with private algorithms. However, these formulas either provide very general bounds on the privacy loss, at the cost of being overly pessimistic for certain types of private algorithms, or they can be too narrow in scope to apply to general privacy systems. In this work, we unify existing privacy loss composition bounds for special classes of differentially private (DP) algorithms along with general DP composition bounds. In particular, we provide strong privacy loss bounds when an analyst may select pure DP, bounded range (e.g. exponential mechanisms), or concentrated DP mechanisms in any order. We also provide optimal privacy loss bounds that apply when an analyst can select pure DP and bounded range mechanisms in a batch, i.e. non-adaptively. Further, when an analyst selects mechanisms within each class adaptively, we show a difference in privacy loss between different, predetermined orderings of pure DP and bounded range mechanisms. Lastly, we compare the composition bounds of Laplace and Gaussian mechanisms based on histogram datasets.

研究动机与目标

  • 在自适应和非自适应设置下,统一现有纯 DP、有界范围(BR)和集中差分隐私(CDP)机制的隐私损失组合边界。
  • 在非自适应、同质设置下,为混合使用纯 DP 和 BR 机制提供最优组合边界,实现对先前工作中已知边界的插值。
  • 分析在自适应组合中,纯 DP 和 BR 机制的顺序如何影响隐私损失,揭示出非平凡的依赖关系。
  • 比较拉普拉斯和高斯机制在私有直方图查询中的表现,表明截断高斯噪声可在保持相同隐私水平的前提下实现更好的实用性。
  • 开发基于截断高斯噪声的新私有 top-$k$ 算法,其性能优于 LinkedIn 等现有系统。

提出的方法

  • 提出一种自适应组合的一般框架,其中隐私参数预先注册且无放回选择,支持灵活的机制排序。
  • 推导出具有相同隐私参数的纯 DP 和 BR 机制混合在非自适应情况下的最优组合边界,实现经典 DP 与 BR 边界之间的平滑插值。
  • 利用 R{\'e}nyi 散度和 zCDP(零集中差分隐私)分析高斯机制的隐私损失,特别关注截断情况。
  • 提出一种新机制 TruncGauss,对直方图计数应用截断高斯噪声,降低尾部风险并改善隐私-实用性权衡。
  • 在加噪后利用后处理不变性对阈值结果进行处理,确保隐私损失不会增加。
  • 通过事件 $E$ 和 $E'$ 的并集界,推导出相邻直方图中多次计数更新的整体 zCDP 保障。

实验结果

研究问题

  • RQ1在自适应组合中,纯 DP 和有界范围(BR)机制的顺序如何影响整体隐私损失?
  • RQ2能否为具有相同隐私参数的非自适应纯 DP 和 BR 机制混合推导出最优组合边界?
  • RQ3在私有直方图查询中,使用截断高斯噪声而非拉普拉斯噪声时,隐私-实用性权衡如何?
  • RQ4在相同的 $\varepsilon$-$\delta$ 隐私保证下,拉普拉斯和高斯机制在私有 top-$k$ 查询中的组合边界如何比较?
  • RQ5对于异构机制,能否高效计算最优组合边界,特别是在机制自适应选择的情况下?

主要发现

  • 在自适应组合中,隐私损失取决于纯 DP 和 BR 机制的顺序,两个 BR 机制的隐私损失因位置不同而表现出可测量的差异。
  • 在非自适应设置中,若包含 $m$ 个纯 DP 和 $k-m$ 个 BR 机制,最优组合边界在 $m=k$(纯 DP)和 $m=0$(仅 BR)边界之间实现平滑插值。
  • 截断高斯噪声可降低偏移高斯分布之间的 R{\'e}nyi 散度,从而获得比无界噪声更紧的隐私边界。
  • 所提出的 TruncGauss 机制对相邻直方图中 $\Delta$ 的计数变化实现了 $\delta$-近似 $\tfrac{\Delta}{2\sigma^2}$-zCDP,且实用性更优。
  • 在私有 top-$k$ 查询中,基于新高斯机制的算法在相同 $(\varepsilon,\delta)$-DP 约束下,相比基于拉普拉斯的方案,噪声幅度更小且隐私效率更高。
  • TruncGauss 中的截断水平是固定且低于等效拉普拉斯机制的水平,从而降低了尾部风险并提升了准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。