Skip to main content
QUICK REVIEW

[论文解读] LASG: Lazily Aggregated Stochastic Gradients for Communication-Efficient Distributed Learning

Tianyi Chen, Yuejiao Sun|arXiv (Cornell University)|Feb 26, 2020
Stochastic Gradient Optimization Techniques参考文献 31被引用 14
一句话总结

本文提出LASG,一种用于分布式学习的通信高效随机优化方法,通过基于动态创新条件选择性地使用最新或过时梯度,自适应地跳过冗余的梯度通信。LASG在实践中将总通信量减少了高达一个数量级,同时保持与标准SGD相当的收敛速率,尤其在通信成本较高的联邦学习和分布式学习环境中表现优异。

ABSTRACT

This paper targets solving distributed machine learning problems such as federated learning in a communication-efficient fashion. A class of new stochastic gradient descent (SGD) approaches have been developed, which can be viewed as the stochastic generalization to the recently developed lazily aggregated gradient (LAG) method --- justifying the name LASG. LAG adaptively predicts the contribution of each round of communication and chooses only the significant ones to perform. It saves communication while also maintains the rate of convergence. However, LAG only works with deterministic gradients, and applying it to stochastic gradients yields poor performance. The key components of LASG are a set of new rules tailored for stochastic gradients that can be implemented either to save download, upload, or both. The new algorithms adaptively choose between fresh and stale stochastic gradients and have convergence rates comparable to the original SGD. LASG achieves impressive empirical performance --- it typically saves total communication by an order of magnitude.

研究动机与目标

  • 为解决在分布式和联邦机器学习中频繁在服务器与工作者之间交换模型参数导致性能下降的高通信开销问题。
  • 开发一种智能的随机梯度方法,可在不牺牲收敛速度的前提下跳过无信息量的通信轮次。
  • 设计适用于服务器端和工作者端计算的自适应、轻量级条件,以决定何时传输最新梯度或重用过时梯度。
  • 在分布式优化中大幅降低总通信成本的同时,保持与标准SGD相当的收敛保证。
  • 在多种数据集和设置下(包括同质和异质数据划分)对方法进行经验评估。

提出的方法

  • LASG采用懒惰聚合策略,服务器仅在每次迭代中使用来自工作者的选定显著梯度创新来维护和更新全局梯度估计。
  • 该方法基于梯度创新幅度(即当前梯度与先前使用梯度之差)的条件,动态选择与哪些工作者通信。
  • 提出两种自适应通信规则:一种在工作者端执行(LASG-WK),另一种在服务器端执行(LASG-PS),从而在通信、计算和内存使用方面提供灵活性。
  • 按工作者跟踪梯度的过时程度;若某工作者被跳过,其梯度过时程度增加,重新参与通信时则被重置。
  • 通过仅传输显著的梯度变化来维持收敛性,从而减少冗余通信,同时保留优化进度。
  • 理论分析表明,在温和假设下,LASG的收敛速率与标准SGD相同,且对期望次优性的边界有明确表达。

实验结果

研究问题

  • RQ1能否设计一种随机梯度方法,在不降低收敛性能的前提下减少分布式学习中的通信开销?
  • RQ2在分布式随机优化设置中,如何利用自适应、轻量级条件来决定何时跳过或传输梯度更新?
  • RQ3使用过时梯度而非最新梯度对收敛性有何影响?如何控制以维持性能?
  • RQ4在通信效率和最终目标值方面,LASG与现有方法(如SGD、Local SGD、QSGD和LAG)相比表现如何?
  • RQ5LASG在同质和异质数据划分场景下能否保持收敛保证?

主要发现

  • 在多个数据集(包括 ijcnn1、MNIST 和 covtype)上,LASG相比标准SGD将总通信量减少了高达一个数量级。
  • 在逻辑回归任务中,LASG在 ijcnn1 上经过1000轮后达到最低目标值0.2252,优于SGD(0.4276)和 LAG-WK(0.3352)。
  • 在MNIST上的神经网络任务中,LASG在10,000次通信轮次后达到测试目标值0.0395,显著优于SGD(0.1612)和Local SGD(0.2388)。
  • 在异质数据设置中,LASG保持了强劲性能,经过100,000比特上传后,ijcnn1上的目标值为0.2296,MNIST上为0.1710,优于QSGD和LAQSG。
  • 理论分析确认,LASG保持与标准SGD相同的收敛速率,且次优性边界为O(1/K)(固定步长)和O(1/√K)(递减步长)。
  • 实验结果表明,LASG-WK和LASG-PS变体性能相当,LASG-PS在早期迭代中通常表现出略优的收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。