Skip to main content
QUICK REVIEW

[论文解读] Sample and Threshold Differential Privacy: Histograms and applications

Akash Bharadwaj, Graham Cormode|arXiv (Cornell University)|Dec 10, 2021
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本文提出了一种样本与阈值机制,通过利用数据收集过程中固有的采样行为,在联邦设置下实现直方图估计的$(\epsilon,\delta)$-差分隐私,无需显式添加噪声。该方法提供准确的频率估计,支持高频项和分位数查询,并在实现开销极小的情况下提供强大的隐私保护。

ABSTRACT

Federated analytics seeks to compute accurate statistics from data distributed across users' devices while providing a suitable privacy guarantee and being practically feasible to implement and scale. In this paper, we show how a strong $(ε, δ)$-Differential Privacy (DP) guarantee can be achieved for the fundamental problem of histogram generation in a federated setting, via a highly practical sampling-based procedure that does not add noise to disclosed data. Given the ubiquity of sampling in practice, we thus obtain a DP guarantee almost for free, avoid over-estimating histogram counts, and allow easy reasoning about how privacy guarantees may obscure minorities and outliers. Using such histograms, related problems such as heavy hitters and quantiles can be answered with provable error and privacy guarantees. Experimental results show that our sample-and-threshold approach is accurate and scalable.

研究动机与目标

  • 为联邦分析中的差分私有直方图计算提供一种实用且高效的方法。
  • 证明仅通过采样——无需显式添加噪声——即可为频率估计提供强大的差分隐私保证。
  • 将该机制扩展至支持高频项、分位数和范围查询,并提供可证明的误差与隐私边界。
  • 表明该方法具备可扩展性,并能无缝集成到已采用用户采样的现有联邦系统中。
  • 基于目标$\epsilon$和$\delta$值,提供设定采样率与阈值的紧密分析边界。

提出的方法

  • 该机制使用泊松采样随机选择用户子集,引入的不确定性构成了差分隐私的基础。
  • 每个客户端仅报告其对应的项目(映射到一个桶),服务器将这些报告聚合为频率直方图。
  • 将频率低于预设阈值$\tau$的项目从输出直方图中剔除,以防止泄露稀有项目计数信息。
  • 采样与阈值的结合确保了样本中低频项目的存在不会暴露其在完整数据集中的真实计数。
  • 理论分析表明,该过程满足$(\epsilon,\delta)$-差分隐私,其边界由采样率和阈值决定。
  • 该方法专为联邦设置设计,其中采样已为常见操作,因此隐私机制在实现成本上可视为‘免费’。

实验结果

研究问题

  • RQ1仅通过采样——不添加显式噪声——能否为直方图估计提供强大的$(\epsilon,\delta)$-差分隐私保证?
  • RQ2如何结合采样与阈值以确保隐私的同时保持准确的频率估计?
  • RQ3该机制在多大程度上可扩展以支持高频项与分位数查询,并提供可证明的误差与隐私边界?
  • RQ4如何为设定采样率与阈值以满足目标$\epsilon$与$\delta$值提供紧密的分析边界?
  • RQ5与现有的洗牌和本地差分隐私模型相比,该方法在效率与隐私放大方面表现如何?

主要发现

  • 样本与阈值机制在不添加显式噪声的情况下实现了$(\epsilon,\delta)$-差分隐私,完全依赖于采样引入的不确定性。
  • 该方法为输入数据集中项目的频率估计提供了准确的结果,其误差边界与采样率和阈值成适当比例。
  • 实验结果证实,该方法在准确性和可扩展性方面表现优异,在真实的联邦设置中运行良好。
  • 通过利用私有直方图为基底,该机制自然支持下游分析任务,如高频项检测与分位数估计。
  • 该方法极具实用性,因为采样在联邦系统中已普遍存在,使得隐私机制轻量化且易于部署。
  • 理论分析表明,隐私保证是紧密的,可通过采样率与阈值精确校准,以满足目标$\epsilon$与$\delta$水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。