[论文解读] FedSel: Federated SGD under Local Differential Privacy with Top-k Dimension Selection
FedSel 提出了一种在局部差分隐私(LDP)下的两阶段联邦SGD框架,通过基于梯度幅值的私有Top-k维度选择,缓解了维度问题,将噪声依赖性从O(√d)降低至O(1/√d)。与最先进的LDP方法相比,该方法提升了模型准确率并降低了所需的批量大小,且在隐私性、效用性和收敛稳定性方面均具备理论和实证验证。
As massive data are produced from small gadgets, federated learning on mobile devices has become an emerging trend. In the federated setting, Stochastic Gradient Descent (SGD) has been widely used in federated learning for various machine learning models. To prevent privacy leakages from gradients that are calculated on users' sensitive data, local differential privacy (LDP) has been considered as a privacy guarantee in federated SGD recently. However, the existing solutions have a dimension dependency problem: the injected noise is substantially proportional to the dimension $d$. In this work, we propose a two-stage framework FedSel for federated SGD under LDP to relieve this problem. Our key idea is that not all dimensions are equally important so that we privately select Top-k dimensions according to their contributions in each iteration of federated SGD. Specifically, we propose three private dimension selection mechanisms and adapt the gradient accumulation technique to stabilize the learning process with noisy updates. We also theoretically analyze privacy, accuracy and time complexity of FedSel, which outperforms the state-of-the-art solutions. Experiments on real-world and synthetic datasets verify the effectiveness and efficiency of our framework.
研究动机与目标
- 解决基于LDP的联邦SGD中的维度依赖问题,其中噪声随维度d增加而增长,导致模型效用下降。
- 降低实现可接受准确率所需的客户端批量大小,当前现有LDP-SGD方法中该值与d线性相关。
- 设计满足ε-LDP的私有Top-k维度选择机制,在保持模型效用的同时最小化隐私成本。
- 通过采用减少方差的梯度累积技术,稳定在噪声和延迟更新下的训练收敛性。
- 设计一种无需超参数调整的维度选择策略,以在客户端参与动态变化时保持性能。
提出的方法
- 提出两阶段框架:(1) 使用三种新型LDP机制进行私有Top-k维度选择;(2) 在选定维度上进行值扰动并注入噪声。
- 设计三种私有Top-k选择机制——基于指数机制、阈值法和自适应采样法——每种均满足ε-LDP,且与值扰动阶段相互独立。
- 通过引入动量的梯度累积技术,提升在噪声更新下的训练稳定性,降低LDP噪声带来的方差。
- 理论上分析隐私性(ε-LDP)、效用性(误差缩减)和时间复杂度,证明其维度依赖性从O(√d)改善至O(1/√d)。
- 提出一种无需超参数调整的策略,通过设定安全阈值θ=0.2来引导选择,无需调参,适用于动态批量大小。
- 在真实和合成数据集上实现并评估FedSel,与平坦化和压缩型LDP-SGD基线方法进行对比。
实验结果
研究问题
- RQ1私有Top-k梯度维度选择能否减少基于LDP的联邦SGD中由维度引起的噪声?
- RQ2与随机投影或平坦LDP机制相比,私有Top-k选择在模型准确率和所需批量大小方面表现如何?
- RQ3结合方差减少的梯度累积能否稳定联邦训练中LDP噪声下的收敛性?
- RQ4无需超参数调整的选择策略是否能在不同客户端参与水平下保持性能?
- RQ5在LDP下,Top-k选择中隐私(ε)、效用(误差)和计算成本之间的理论权衡是什么?
主要发现
- FedSel将LDP估计误差的缩放从O(√d)降低至O(1/√d),显著提升了高维场景下的模型效用。
- 实现可接受准确率所需的批量大小缩放为Ω(E² log d / (d ε²)),远低于平坦LDP-SGD的O(E² d log d / ε²)。
- 所提出的无需超参数调整的策略(θ=0.2)在动态批量大小下保持稳定性能,其偏差低于私有基线方法。
- 三种私有Top-k选择机制均优于私有基线,其中性能最佳的方法在真实数据集上实现最高15%的测试准确率提升。
- 改进的梯度累积技术降低了噪声更新的方差,有助于在延迟和扰动梯度下实现稳定收敛。
- 实证结果证实,选择高幅值维度可提升学习效率,而舍弃不重要梯度则能有效降低噪声影响,且不会造成显著效用损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。