Skip to main content
QUICK REVIEW

[论文解读] Order-Invariant Cardinality Estimators Are Differentially Private

Charlie Dickens, Justin Thaler|arXiv (Cornell University)|Mar 29, 2022
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文证明,当输入流基数至少为 $\Omega(k/\epsilon)$ 时,通过简单的下采样过程,顺序不变的基于哈希的基数估计算法(如 HyperLogLog 和 Bottom-k)本质上具有 $\epsilon$-差分隐私。作者建立了比以往工作更紧致的隐私界限,表明这些算法在不损害实用性的前提下实现了 $\epsilon$-差分隐私,并通过实验验证了该方法在速度和空间效率上显著优于以往方法。

ABSTRACT

We consider privacy in the context of streaming algorithms for cardinality estimation. We show that a large class of algorithms all satisfy $ε$-differential privacy, so long as (a) the algorithm is combined with a simple down-sampling procedure, and (b) the cardinality of the input stream is $Ω(k/ε)$. Here, $k$ is a certain parameter of the sketch that is always at most the sketch size in bits, but is typically much smaller. We also show that, even with no modification, algorithms in our class satisfy $(ε, δ)$-differential privacy, where $δ$ falls exponentially with the stream cardinality. Our analysis applies to essentially all popular cardinality estimation algorithms, and substantially generalizes and tightens privacy bounds from earlier works.

研究动机与目标

  • 为现实系统中广泛使用的实用基数估计算法建立强有力的差分隐私保障。
  • 证明当结合简单的下采样过程并满足一个温和的基数下界时,这些算法可实现 $\epsilon$-差分隐私。
  • 改进 HyperLogLog 和 Bottom-k 等流行算法的先前隐私界限,提供更紧致的 $\delta$ 值,并实现完整的 $\epsilon$-DP 而非 $(\epsilon,\delta)$-DP。
  • 通过实验评估证明,所提方法在性能和空间效率上均优于现有 $\epsilon$-差分隐私基数估计算法。

提出的方法

  • 作者在假设哈希函数为保密的前提下,分析了一类具有有界大小的顺序不变、基于哈希的草图,包括 HyperLogLog 和 Bottom-k。
  • 他们引入了一种下采样过程,以确保流基数超过阈值 $n_0 = \frac{k_{\text{max}}}{1 - e^{-\epsilon}}$,从而实现 $\epsilon$-差分隐私。
  • 隐私分析依赖于在输入变化较小时对草图更新的敏感度进行有界,利用了顺序不变性和有界草图大小的特性。
  • 理论界限表明,即使不进行下采样,这些草图在基数超过某一阈值后,也满足 $(\epsilon,\delta)$-差分隐私,且 $\delta$ 随基数呈指数衰减。
  • 通过两个实验验证该方法:一个测量更新时间,另一个比较在相同误差水平下的草图空间使用量。
  • 实现了所提出的 HLL 私有变体(PHLL),并与先前的 $\epsilon$-DP HLL 变体 QLL 进行比较,结果表明 PHLL 在速度和空间效率方面均表现更优。

实验结果

研究问题

  • RQ1能否在温和条件下证明一类广泛的实际基数估计算法满足 $\epsilon$-差分隐私?
  • RQ2添加下采样过程如何影响这些草图的隐私性和实用性?
  • RQ3能否为 HyperLogLog 和 Bottom-k 等现有草图推导出比以往工作更紧致的隐私界限?
  • RQ4与以往的 $\epsilon$-DP 核心估计算法相比,所提方法在性能和空间效率方面表现如何?

主要发现

  • 本文确立了:当流基数超过 $\Omega(k/\epsilon)$ 时,若应用下采样过程,顺序不变、基于哈希的基数估计算法可满足 $\epsilon$-差分隐私。
  • 即使不进行下采样,当基数超过某一阈值后,这些草图也满足 $(\epsilon,\delta)$-差分隐私,且 $\delta$ 随基数呈指数衰减。
  • 所提方法实现了比以往工作更紧致的隐私界限,尤其在 HyperLogLog 上表现更优,优于现有 $(\epsilon,\delta)$-DP 保障。
  • 实验结果表明,所提 PHLL 方法在 $k = 2^{12}$ 时比 QLL 方法快约 500 倍,得益于常数时间更新,同时保持相近的准确性。
  • 在高精度下($k = 2^{12}$),PHLL 所用空间最多仅为 QLL 的 1.6 倍,且随着所需精度提高,空间优势呈指数增长。
  • 该方法使现有生产系统能够通过预处理或原生部署轻松采用差分隐私,仅需满足基数约束条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。