[论文解读] Privacy Amplification via Compression: Achieving the Optimal Privacy-Accuracy-Communication Trade-off in Distributed Mean Estimation
本文提出了一种基于压缩的隐私放大技术,用于分布式均值估计,在联合约束下实现了 $(\varepsilon,\delta)$-差分隐私下的最优隐私-通信-精度权衡。通过让客户端仅传输其数据中随机选择的部分,该方法利用客户端侧的随机性实现隐私放大,从而显著降低通信开销——在联邦学习中可减少至 $\Theta(n\min(\varepsilon,\varepsilon^2))$ 位,在频率分析中可减少至 $\Theta(\log(n\min(\varepsilon,\varepsilon^2)))$ 位,同时保持 $\ell_2$ 误差的阶次最优。
Privacy and communication constraints are two major bottlenecks in federated learning (FL) and analytics (FA). We study the optimal accuracy of mean and frequency estimation (canonical models for FL and FA respectively) under joint communication and $(\varepsilon, δ)$-differential privacy (DP) constraints. We show that in order to achieve the optimal error under $(\varepsilon, δ)$-DP, it is sufficient for each client to send $Θ\left( n \min\left(\varepsilon, \varepsilon^2 ight) ight)$ bits for FL and $Θ\left(\log\left( n\min\left(\varepsilon, \varepsilon^2 ight) ight) ight)$ bits for FA to the server, where $n$ is the number of participating clients. Without compression, each client needs $O(d)$ bits and $\log d$ bits for the mean and frequency estimation problems respectively (where $d$ corresponds to the number of trainable parameters in FL or the domain size in FA), which means that we can get significant savings in the regime $ n \min\left(\varepsilon, \varepsilon^2 ight) = o(d)$, which is often the relevant regime in practice. Our algorithms leverage compression for privacy amplification: when each client communicates only partial information about its sample, we show that privacy can be amplified by randomly selecting the part contributed by each client.
研究动机与目标
- 为填补在联合约束下理解分布式均值估计中隐私、通信与精度之间最优权衡的空白。
- 探究在联邦学习与数据分析中,是否可以在不牺牲精度或隐私的前提下提升通信效率。
- 开发一种方法,使客户端在仅发送更少信息的同时,仍能实现最优的隐私-精度-通信权衡。
- 将基于压缩的隐私放大扩展至中心化和多消息混淆差分隐私模型,确保可信性与效率。
提出的方法
- 客户端仅传输其数据中随机选择的子集(例如随机选择的模型参数或直方图条目),从而降低通信负载。
- 通过在每个客户端选择数据部分时引入随机性来实现隐私放大,使服务器无法将特定部分与特定客户端关联。
- 在中心化 DP 模型中,服务器接收并聚合压缩后的数据,实现通信减少下的最优 $\ell_2$ 误差。
- 在多消息混淆模型中,每个客户端通过安全混淆器本地对所选数据部分进行私有化和匿名化,从而无需可信服务器。
- 通过在多轮中分配隐私预算,确保在混淆机制下保持最优隐私保障。
- 理论分析表明,$\ell_2$ 误差为阶次最优,达到 $O\left(\frac{C^2 d}{n^2 \min(\varepsilon^2, \varepsilon)}\right)$ 的误差,仅相差对数因子。

实验结果
研究问题
- RQ1是否可以在不降低隐私或精度的前提下,减少分布式均值估计中的通信负载?
- RQ2客户端数据的随机压缩是否能带来隐私放大?若能,其适用条件是什么?
- RQ3在中心化和多消息混淆差分隐私模型中,是否能实现最优的隐私-精度-通信权衡?
- RQ4在 $(\varepsilon,\delta)$-DP 下,实现阶次最优 $\ell_2$ 误差所需的最小通信成本是多少?
- RQ5与现有本地差分隐私和混淆差分隐私机制相比,所提方法在实际性能上表现如何?
主要发现
- 所提方法在 $(\varepsilon,\delta)$-DP 下实现了阶次最优的 $\ell_2$ 误差 $O\left(\frac{C^2 d}{n^2 \min(\varepsilon^2, \varepsilon)}\right)$,仅相差对数因子。
- 在联邦学习中,客户端仅需通信 $\Theta(n\min(\varepsilon,\varepsilon^2))$ 位,在频率估计中仅需 $\Theta(\log(n\min(\varepsilon,\varepsilon^2)))$ 位,即可实现最优精度。
- 在高隐私场景($\varepsilon \leq 0.5$)下,CSGM 使用 $b=50$ 位时,对 $d=500$ 实现 10 倍压缩,对 $d=5000$ 实现 100 倍压缩,且均方误差无损失。
- 在固定 10 位通信预算下,CSGM 在均方误差方面优于混淆 DP 和本地 DP 机制。
- 即使在 $n\min(\varepsilon,\varepsilon^2) = o(d)$ 的情况下(这在实践中很常见),基于压缩的隐私放大依然有效,从而实现显著的通信节省。
- 基于混淆的变体实现了与中心化模型相同的最优权衡,并消除了对可信服务器的需求,使系统可部署于不可信环境。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。