Skip to main content
QUICK REVIEW

[论文解读] Accelerating Federated Learning via Momentum Gradient Descent

Wei Liu, Li Chen|arXiv (Cornell University)|Oct 8, 2019
Privacy-Preserving Technologies in Data参考文献 32被引用 11
一句话总结

本文提出动量联邦学习(Momentum Federated Learning, MFL),将动量梯度下降(Momentum Gradient Descent, MGD)引入联邦学习的本地更新阶段,以加速收敛。通过利用历史梯度,MFL 在收敛速度上优于标准联邦学习(FL),理论分析与 MNIST 上的实验验证了显著改进,尤其在动量参数 γ ≈ 0.9 且聚合频率 τ 适当调优时效果更佳。

ABSTRACT

Federated learning (FL) provides a communication-efficient approach to solve machine learning problems concerning distributed data, without sending raw data to a central server. However, existing works on FL only utilize first-order gradient descent (GD) and do not consider the preceding iterations to gradient update which can potentially accelerate convergence. In this paper, we consider momentum term which relates to the last iteration. The proposed momentum federated learning (MFL) uses momentum gradient descent (MGD) in the local update step of FL system. We establish global convergence properties of MFL and derive an upper bound on MFL convergence rate. Comparing the upper bounds on MFL and FL convergence rate, we provide conditions in which MFL accelerates the convergence. For different machine learning models, the convergence performance of MFL is evaluated based on experiments with MNIST dataset. Simulation results comfirm that MFL is globally convergent and further reveal significant convergence improvement over FL.

研究动机与目标

  • 为解决标准联邦学习(FL)收敛缓慢的问题,其仅依赖一阶梯度下降,未利用历史迭代信息。
  • 通过在本地训练过程中引入动量,提升分布式机器学习中的通信效率与收敛速度。
  • 在现实联邦学习系统条件下,为所提出的 MFL 框架建立理论收敛保证。
  • 通过 MNIST 数据集的实证验证,证明 MFL 在收敛速度与最终模型精度方面优于 FL。

提出的方法

  • 在联邦学习的本地更新步骤中引入动量梯度下降(MGD),其中每个客户端基于前一梯度方向使用动量项。
  • 推导出 MFL 收敛速率的理论上界,表明在特定条件下可实现线性收敛至全局最优。
  • 提出一种改进的更新规则,将本地模型更新与动量项 γ 结合,其中 γ 控制历史梯度的影响。
  • 分析在不同聚合频率 τ 与学习率 η 下的收敛行为,识别出最优参数范围。
  • 采用全局聚合策略,客户端每 τ 个本地步骤向服务器发送模型参数,以保持通信效率。
  • 使用 MNIST 数据集在三种模型(SVM、逻辑回归、线性回归)上验证方法,记录迭代过程中的损失与准确率。

实验结果

研究问题

  • RQ1与标准梯度下降相比,动量梯度下降是否能提升联邦学习的收敛速度?
  • RQ2在何种条件下,所提出的 MFL 方法相比标准 FL 实现加速收敛?
  • RQ3超参数 γ(动量系数)与 τ(聚合频率)如何影响 MFL 的收敛速度与最终模型性能?
  • RQ4MFL 的收敛速率理论上限是什么?与 FL 相比有何差异?
  • RQ5MFL 是否在实现更快收敛的同时保持全局收敛性,尤其在非独立同分布数据与有限通信条件下?

主要发现

  • MFL 在所有测试模型(SVM、逻辑回归、线性回归)上均实现比标准 FL 更快的收敛,MNIST 数据集上的损失函数曲线下降更陡峭。
  • 当 γ ≈ 0.9 时,MFL 达到最优收敛速率;若 γ 超过 0.95,性能反而下降,甚至出现发散。
  • 当 τ < 100 时,聚合频率对收敛影响较小;但当 τ > 100 时,收敛性能显著下降,表明通信成本与性能之间存在权衡。
  • 在 0 < γ < 1 范围内,MFL 的最终损失值始终低于 FL,证实其优化效率更高。
  • 理论分析表明,在给定假设下,MFL 可线性收敛至全局最优,当条件 2(1−βη)cosθ / (βηp²) > 1 成立时,收敛速度进一步加快。
  • 仿真结果证实,MFL 具有全局收敛性,且在收敛速度上优于 FL 与集中式 MGD,尤其在中等 τ 与最优 γ 条件下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。