QUICK REVIEW
[论文解读] Differentially Private Aggregation in the Shuffle Model: Almost Central Accuracy in Almost a Single Message
Badih Ghazi, Ravi Kumar|arXiv (Cornell University)|Sep 27, 2021
Privacy-Preserving Technologies in Data被引用 7
一句话总结
本文提出了一种在shuffle模型下的差分隐私聚合协议,实现了接近中心化模型的准确性——其误差与中心化模型中拉普拉斯机制的误差相当——同时每位用户平均仅需发送 1 + o(1) 条消息。通过使用相关噪声注入和随机舍入,该协议将通信开销降至最低,消息长度接近非私有基线,从而在大规模系统中实现高效且私密的实数聚合。
ABSTRACT
The shuffle model of differential privacy has attracted attention in the literature due to it being a middle ground between the well-studied central and local models. In this work, we study the problem of summing (aggregating) real numbers or integers, a basic primitive in numerous machine learning tasks, in the shuffle model. We give a protocol achieving error arbitrarily close to that of the (Discrete) Laplace mechanism in the central model, while each user only sends $1 + o(1)$ short messages in expectation.
研究动机与目标
- 弥合差分隐私中中心化模型的高准确性和本地化模型的强隐私性之间的差距。
- 设计一种适用于实数聚合的shuffle模型协议,使其误差接近中心化模型中拉普拉斯机制的水平。
- 最小化通信开销,确保每位用户平均仅发送略多于一条消息。
- 保持低消息大小,即使在强隐私约束下也接近非私有基线。
- 实现在实时和联邦学习等通信成本至关重要的场景中的实际部署。
提出的方法
- 协议使用随机舍入将实数离散化为有限集合 {0, 1, ..., Δ},从而将问题转化为 Δ-求和问题。
- 提出一种相关噪声机制,其统计特性模仿中心化模型中离散拉普拉斯分布的特性。
- 每位用户以精心设计的概率分布发送随机数量的消息——期望值为 1 + o(1),在隐私与准确性之间实现平衡。
- 混淆器对消息进行随机排列,确保每条独立消息均满足差分隐私。
- 分析器通过合并经混淆的消息并应用逆舍入操作来重建总和,从而最小化估计误差。
- 通过精细校准噪声和消息分布,协议实现了 (ε, δ)-差分隐私。
实验结果
研究问题
- RQ1我们能否在shuffle模型中以极低的通信开销实现接近中心化模型的准确性?
- RQ2是否可能设计一种协议,使每位用户仅发送 1 + o(1) 条消息,同时保持强隐私性?
- RQ3在 (ε, δ)-DP 约束下,能否将消息大小保持在接近非私有基线的水平?
- RQ4所提协议的误差与 RAPPOR、IKOS 及中心化拉普拉斯机制等现有方法相比如何?
- RQ5该协议能否在大规模系统(如联邦学习或人口普查数据收集)中实现高效扩展?
主要发现
- 协议实现的均方误差(MSE)可任意接近参数为 (1−ζ)ε 的拉普拉斯机制的误差,其中任意 ζ > 0。
- 每位用户平均发送 1 + Õζ,ε(log(1/δ)/√n) 条消息,随着 n 增大,该值渐近趋近于一条消息。
- 每条消息仅包含 ½log n + O(log(1/ζ)) 比特,与非私有通信成本相比仅相差低阶项。
- 在误差和通信开销方面,协议优于 RAPPOR 和 IKOS,尤其在高离散化级别(Δ=200)时表现更优。
- 当 Δ=200 时,所提协议的均方根误差(RMSE)小于 RAPPOR 的一半,且通信开销保持在 60% 以下。
- 通信成本几乎恒定,且与 δ 和 ε 无关,而其他协议的通信开销会随 1/δ 增大或随 ε 减小而变化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。