Skip to main content
QUICK REVIEW

[论文解读] Federated Stochastic Gradient Langevin Dynamics

Khaoula El Mekkaoui, Diego Mesquita|Työväentutkimus Vuosikirja|Apr 23, 2020
Markov Chains and Monte Carlo Methods参考文献 27被引用 5
一句话总结

本文提出联邦随机梯度朗之万动力学(FSGLD),一种新方法,通过引入‘有利梯度’——一种利用局部似然近似来校正偏差梯度估计的方差减少机制——在联邦非独立同分布(non-IID)设置下改进后验采样。FSGLD 即使在通信延迟情况下也能收敛到真实后验分布,在度量学习和神经网络实验中均优于 DSGLD,尤其在非 IID 数据上表现更优。

ABSTRACT

Stochastic gradient MCMC methods, such as stochastic gradient Langevin dynamics (SGLD), employ fast but noisy gradient estimates to enable large-scale posterior sampling. Although we can easily extend SGLD to distributed settings, it suffers from two issues when applied to federated non-IID data. First, the variance of these estimates increases significantly. Second, delaying communication causes the Markov chains to diverge from the true posterior even for very simple models. To alleviate both these problems, we propose conducive gradients, a simple mechanism that combines local likelihood approximations to correct gradient updates. Notably, conducive gradients are easy to compute, and since we only calculate the approximations once, they incur negligible overhead. We apply conducive gradients to distributed stochastic gradient Langevin dynamics (DSGLD) and call the resulting method federated stochastic gradient Langevin dynamics (FSGLD). We demonstrate that our approach can handle delayed communication rounds, converging to the target posterior in cases where DSGLD fails. We also show that FSGLD outperforms DSGLD for non-IID federated data with experiments on metric learning and neural networks.

研究动机与目标

  • 解决分布式 SGLD(DSGLD)在联邦非独立同分布(non-IID)设置下收敛性差、方差高的问题。
  • 在数据在客户端之间划分且通信不频繁的联邦学习中,实现可靠的后验采样。
  • 开发一种在保持计算效率的同时,相比现有分布式 SG-MCMC 方法提升采样精度的方法。
  • 为 DSGLD 和所提出的 FSGLD 方法提供理论收敛界。
  • 证明:每个客户端仅计算一次的有利梯度,能显著降低采样方差,并在非 IID 情况下提升泛化性能。

提出的方法

  • 引入‘有利梯度’——一种均值为零的随机函数,通过组合每个客户端的局部似然近似来校正梯度更新。
  • 在训练前,为每个客户端一次性计算局部似然代理(例如,对角多变量正态近似),开销可忽略不计。
  • 通过在 DSGLD 梯度估计器中添加有利梯度,以减少非 IID 数据带来的方差与偏差。
  • 采用控制变量子原则以稳定马尔可夫链,提升向真实后验分布的收敛性。
  • 采用通信高效的协议,仅共享本地近似一次,而非完整梯度或数据。
  • 推导了 DSGLD 和 FSGLD 的收敛界,表明在数据异构性和延迟通信条件下,FSGLD 具有更高的稳定性。

实验结果

研究问题

  • RQ1基于局部似然近似的方差减少机制,能否改善联邦非独立同分布(non-IID)设置下的后验采样?
  • RQ2当 DSGLD 因通信延迟或数据异构性而失效时,所提出的 FSGLD 方法是否仍能收敛到真实后验分布?
  • RQ3局部似然代理的选择如何影响 FSGLD 的收敛性和性能?
  • RQ4FSGLD 是否能在保持与 DSGLD 相同计算复杂度的同时,显著提升采样精度?
  • RQ5在联邦非独立同分布数据环境下,DSGLD 和 FSGLD 的收敛性可提供哪些理论保证?

主要发现

  • 在非 IID 数据上,FSGLD 显著优于 DSGLD,在 MLP 实验中平均测试对数似然达 -0.67 ± 0.03,而 DSGLD 为 -1.11 ± 0.312。
  • 在非 IID 情况下,DSGLD 展现出较差的泛化能力,表现为测试对数似然从训练阶段(-0.44)到测试阶段(-1.11)大幅下降,表明存在过拟合或收敛性差的问题。
  • FSGLD 显著降低了采样方差,在多次运行中标准差较 DSGLD 降低超过 50%。
  • 在 DSGLD 失效的情况下(尤其是通信延迟和高数据异构性时),FSGLD 仍能收敛到真实后验分布。
  • 该方法保持了与 DSGLD 相同的计算复杂度,且仅需一次性计算局部似然近似,开销可忽略。
  • FSGLD 的收敛界表明,局部代理的选择(如指数族近似)直接影响边界的紧致性和采样效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。