[论文解读] Renyi Differential Privacy of the Subsampled Shuffle Model in Distributed Learning
本文提出了一种新颖的分析框架,用于分布式学习中子采样洗牌模型下的Rényi差分隐私(RDP),实现了对局部随机化机制的更紧致隐私界。通过推导同时考虑子采样与洗牌的显式RDP界,该方法在组合场景下相比先前的近似差分隐私(DP)方法,显著提升了隐私保障,尤其在强组合情形下表现突出,且在真实数据集上验证了其性能提升。
We study privacy in a distributed learning framework, where clients collaboratively build a learning model iteratively through interactions with a server from whom we need privacy. Motivated by stochastic optimization and the federated learning (FL) paradigm, we focus on the case where a small fraction of data samples are randomly sub-sampled in each round to participate in the learning process, which also enables privacy amplification. To obtain even stronger local privacy guarantees, we study this in the shuffle privacy model, where each client randomizes its response using a local differentially private (LDP) mechanism and the server only receives a random permutation (shuffle) of the clients' responses without their association to each client. The principal result of this paper is a privacy-optimization performance trade-off for discrete randomization mechanisms in this sub-sampled shuffle privacy model. This is enabled through a new theoretical technique to analyze the Renyi Differential Privacy (RDP) of the sub-sampled shuffle model. We numerically demonstrate that, for important regimes, with composition our bound yields significant improvement in privacy guarantee over the state-of-the-art approximate Differential Privacy (DP) guarantee (with strong composition) for sub-sampled shuffled models. We also demonstrate numerically significant improvement in privacy-learning performance operating point using real data sets.
研究动机与目标
- 解决在客户端协作训练模型以保护本地数据的分布式学习中的隐私-效用权衡问题。
- 利用Rényi差分隐私(RDP)对子采样洗牌模型进行严格隐私分析,以实现比近似DP更紧致的组合界。
- 推导适用于任意离散局部差分隐私(LDP)机制在子采样洗牌设置下的显式、可数值计算的RDP界。
- 证明所提出的RDP分析在强组合情形下相比现有方法可实现可测量的隐私-效用性能提升。
- 建立随机梯度下降在洗牌模型下的隐私-收敛权衡,将隐私保障与学习收敛速率相联系。
提出的方法
- 作者提出一种新的理论技术,将子采样洗牌机制的RDP分析简化为对三值 |χ|^α-DP 的分析,从而实现可计算性。
- 推导出任意离散 ε₀-LDP 机制的显式RDP上界,其表达式依赖于RDP阶 λ、子采样率 γ、LDP参数 ε₀ 和客户端数量 n。
- 该方法利用洗牌模型的结构特征:每个客户端应用LDP机制,服务器仅接收消息的随机排列,从而通过洗牌实现隐私放大。
- 同时建立了RDP的下界以验证上界紧致性,基于邻近数据集下二项分布类随机变量的方差计算。
- 使用RDP组合定理对多轮迭代进行隐私分析,随后转换为近似DP以方便实际解释。
- 在凸性和Lipschitz连续性假设下进行收敛性分析,将有界梯度方差与随机梯度下降的收敛速率相联系。
实验结果
研究问题
- RQ1如何为具有任意离散局部随机化机制的子采样洗牌模型,实现Rényi差分隐私的紧致界?
- RQ2在使用RDP组合时,子采样洗牌模型中的隐私-效用权衡如何?与近似DP界相比有何差异?
- RQ3所提出的RDP分析是否能在强组合情形下显著优于现有方法,提供更优的隐私保障?
- RQ4在实际应用场景中,隐私界如何随子采样率、客户端数量和LDP参数 ε₀ 变化?
- RQ5在子采样洗牌模型下,基于推导的隐私约束,随机梯度下降的收敛速率如何?
主要发现
- 所提出的RDP界是显式的、可数值计算的,且适用于所有参数范围,包括先前近似DP界受限的区域。
- 数值结果表明,在强组合情形下,基于RDP的隐私保障显著优于当前最先进的近似DP界,尤其在低隐私场景下表现更优。
- 该方法在真实数据集上实现了可测量的隐私-效用性能提升,证明了其在实际应用中的相关性,而不仅限于理论边界。
- 通过邻近数据集下二项分布类变量的方差分析,建立了与上界匹配的下界,验证了所推导RDP上界的紧致性。
- 隐私-收敛权衡分析表明,该算法实现了 O(DG log(T)/√T) 的收敛速率,其中 G 取决于梯度方差和子采样率。
- 分析揭示,子采样与洗牌带来的隐私放大效应以乘法方式结合,从而提供强于任一机制单独作用的总体隐私保障。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。