Skip to main content
QUICK REVIEW

[论文解读] Differentially private anonymized histograms

Ananda Theertha Suresh|arXiv (Cornell University)|Oct 8, 2019
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本文提出了首个用于发布匿名直方图——即从标记数据中提取的非零计数多重集——的差分隐私机制,实现了近乎最优的隐私-效用权衡。该机制基于直方图的流行度结构设计了一种新颖的噪声添加策略,当输入以紧凑形式表示时,可实现次线性时间计算,并支持在差分隐私下对离散分布的对称性质进行精确估计。

ABSTRACT

For a dataset of label-count pairs, an anonymized histogram is the multiset of counts. Anonymized histograms appear in various potentially sensitive contexts such as password-frequency lists, degree distribution in social networks, and estimation of symmetric properties of discrete distributions. Motivated by these applications, we propose the first differentially private mechanism to release anonymized histograms that achieves near-optimal privacy utility trade-off both in terms of number of items and the privacy parameter. Further, if the underlying histogram is given in a compact format, the proposed algorithm runs in time sub-linear in the number of items. For anonymized histograms generated from unknown discrete distributions, we show that the released histogram can be directly used for estimating symmetric properties of the underlying distribution.

研究动机与目标

  • 为在密码频率列表和社交网络度分布等敏感应用中发布匿名直方图(即非零计数的多重集)的同时保持差分隐私,解决该挑战。
  • 开发一种机制,实现ε参数和项目数量两方面近乎最优的隐私-效用权衡。
  • 通过确保当输入直方图以紧凑的流行度为基础格式表示时,算法运行时间在次线性时间内,从而实现高效计算。
  • 支持直接使用发布的差分隐私直方图对未知离散分布的对称性质(如熵、支撑集大小)进行估计。

提出的方法

  • 提出一种差分隐私机制,向匿名直方图的流行度计数(φr)添加噪声,其中φr表示具有计数r的标签数量。
  • 设计一种针对直方图流行度结构量身定制的新颖噪声分布,确保隐私的同时最小化效用损失。
  • 基于直方图之间的排序ℓ1距离进行敏感性分析,以限制下游性质估计中的误差传播。
  • 通过利用流行度对直方图的紧凑表示,避免显式枚举所有计数,从而设计出次线性时间算法。
  • 将私有直方图发布集成到对称性质的插补估计器框架中,用于离散分布。
  • 通过将总误差分解为三部分来分析误差界:私有估计器的估计误差、样本量差异引起的扰动,以及直方图近似带来的误差。

实验结果

研究问题

  • RQ1能否设计一种差分隐私机制,实现在ε和项目数量两方面均近乎最优的隐私-效用权衡,用于发布匿名直方图?
  • RQ2当输入直方图通过流行度紧凑表示时,该算法如何实现次线性时间复杂度?
  • RQ3发布的差分隐私直方图能否直接用于对底层离散分布的对称性质进行有界误差估计?
  • RQ4使用私有直方图估计对称性质的理论误差界是什么?其随样本大小和隐私参数ε的缩放关系如何?
  • RQ5在不同ε范围(如ε > 1 与 ε ∈ [Ω(1/n), 1])下,该机制在误差和样本复杂度方面的表现如何?

主要发现

  • 所提机制实现了近乎最优的隐私-效用权衡,误差规模为O(n^{β−1/2} e^{−cε})(当ε > 1时),以及O(n^{β−1/2} √(1/ε log(2/ε)))(当ε ∈ [Ω(1/n), 1)时),其中β < 1/2。
  • 当输入直方图通过流行度紧凑表示时,该算法运行在次线性时间,使其在大规模数据集上高效。
  • 发布的私有直方图可直接用作熵、支撑集大小和Rényi熵等对称性质的插补估计器。
  • 准确估计所需的样本复杂度为O((1/(α e^{cε}))^{2/(1−2β)} + (1/ε) log(f_max/α))(当ε > 1时),以及O((√log(2/ε)/(α√ε))^{2/(1−2β)} + (1/ε) log(f_max/(αε)))(当ε ∈ [Ω(1/n), 1)时)。
  • 对称性质f(p)的估计误差界满足E[|f(p) − f̂^p|] ≤ E[ε( f̂, n)] + n^{β−1/2} e^{−cε} + f(p) e^{−nε}(当ε > 1时),对较小ε情况类似,表明在不同隐私范围内均具鲁棒性。
  • 该方法通过控制流行度向量的敏感性并应用校准噪声来确保差分隐私,理论保证了隐私和效用的双重稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。