[论文解读] Hiding Among the Clones: A Simple and Nearly Optimal Analysis of Privacy Amplification by Shuffling
本文提出了一种在差分隐私的shuffle模型中对隐私放大通过随机化进行简化的分析,表明自适应的 ${\varepsilon}_0$-差分隐私本地随机化器序列可产生 $(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/\delta)/n}}, \delta)$-差分隐私算法。该方法在 ${\varepsilon}_0$ 上实现了渐近最优的依赖关系,显著优于先前的界限,并通过三输出分布的散度分析实现了更紧致的数值界限。
Recent work of Erlingsson, Feldman, Mironov, Raghunathan, Talwar, and Thakurta [EFMRTT19] demonstrates that random shuffling amplifies differential privacy guarantees of locally randomized data. Such amplification implies substantially stronger privacy guarantees for systems in which data is contributed anonymously [BEMMRLRKTS17] and has lead to significant interest in the shuffle model of privacy [CSUZZ19; EFMRTT19]. We show that random shuffling of $n$ data records that are input to $\varepsilon_0$-differentially private local randomizers results in an $(O((1-e^{-\varepsilon_0})\sqrt{\frac{e^{\varepsilon_0}\log(1/δ)}{n}}), δ)$-differentially private algorithm. This significantly improves over previous work and achieves the asymptotically optimal dependence in $\varepsilon_0$. Our result is based on a new approach that is simpler than previous work and extends to approximate differential privacy with nearly the same guarantees. Importantly, our work also yields an algorithm for deriving tighter bounds on the resulting $\varepsilon$ and $δ$ as well as Rényi differential privacy guarantees. We show numerically that our algorithm gets to within a small constant factor of the optimal bound. As a direct corollary of our analysis we derive a simple and nearly optimal algorithm for frequency estimation in the shuffle model of privacy. We also observe that our result implies the first asymptotically optimal privacy analysis of noisy stochastic gradient descent that applies to sampling without replacement.
研究动机与目标
- 为解决先前关于隐私放大通过随机化的分析中对本地隐私参数 ${\varepsilon}_0$ 的次优依赖关系,特别是在 ${\varepsilon}_0 > 1$ 时的问题。
- 将分析扩展到近似差分隐私的本地随机化器,其中先前的工作保证较弱。
- 与先前复杂的分析相比,简化证明技术,以提高可扩展性并便于实现。
- 提供一种数值高效的计算方法,用于获得更紧致的隐私界限,包括适用于 Rényi 差分隐私的情形。
- 推导出在 shuffle 模型中频率估计的近似最优算法,并改进噪声随机梯度下降的隐私分析。
提出的方法
- 核心方法将自适应本地算法的隐私分析简化为分析一个非自适应的三输出本地随机化器,利用‘克隆’(clones)的概念——即在统计上与参考输出不可区分的输出。
- 对于 ${\varepsilon}_0 > 1$ 的情形,分析利用克隆的二项分布来界定隐私损失,表明数据点必须隐藏在随机数量的此类克隆之中。
- 对于较小的 ${\varepsilon}_0$,该方法利用这样一个事实:任何在两个输入上的本地随机化器均可分解为二元随机响应和后处理,从而实现更紧的界限。
- 通过分析三输出上两个多项分布之间的 Rényi 散度来计算隐私界限,从而实现数值上紧致的界限。
- 该框架被扩展至近似差分隐私和 Rényi 差分隐私,通过直接计算散度实现数值计算。
- 该方法已实现并开源,使得以极低开销实际计算隐私放大界限成为可能。
实验结果
研究问题
- RQ1能否通过更简化的证明实现对 ${\varepsilon}_0$ 的渐近最优依赖关系,从而分析隐私放大通过随机化?
- RQ2能否将分析扩展到近似差分隐私的本地随机化器,并获得改进的界限?
- RQ3该方法能否产生比现有闭式表达式更紧致的数值隐私界限?
- RQ4该方法是否能为 shuffle 模型中的频率估计提供近似最优的算法?
- RQ5该框架能否用于推导出如噪声随机梯度下降等复合算法的更紧致隐私保证?
主要发现
- 本文实现了 $(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/\delta)/n}}, \delta)$-差分隐私算法,其在 ${\varepsilon}_0 > 1$ 的情形下渐近匹配最优的 $e^{{\varepsilon}_0/2}$ 依赖关系。
- 对于近似差分隐私,该方法将依赖关系从 $e^{20{\varepsilon}_0}$ 改进为 $e^{{\varepsilon}_0/2}$,与二元随机响应的最佳已知界限一致。
- 通过三输出分布的散度分析计算出的数值界限与最优界限仅相差一个常数因子,显著优于先前的最先进水平。
- 该方法可为复合算法提供更紧致的隐私保证:当与高级组合结合使用时,其产生的近似差分隐私界限显著优于现有的基于 RDP 的方法。
- 该方法提供了一种简单且高效的算法,用于计算隐私放大界限,代码已公开发布于 https://github.com/apple/ml-shuffling-amplification。
- 该分析适用于自适应和非自适应的本地随机化器,并可扩展至 Rényi 差分隐私,数值结果表明在各种 RDP 阶数下均表现出近乎最优的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。