Skip to main content
QUICK REVIEW

[论文解读] Local SGD With a Communication Overhead Depending Only on the Number of Workers

Artin Spiridonoff, Alex Olshevsky|arXiv (Cornell University)|Jun 3, 2020
Advanced MIMO Systems Optimization参考文献 36被引用 12
一句话总结

本文提出了一种新型的局部SGD通信策略,仅需Ω(n)次通信轮次(与总迭代次数T无关),即可实现线性加速,使收敛误差缩放为1/(nT)。通过在训练初期动态增加通信间隔,后期逐步减少,该方法在显著降低通信开销的同时最小化残余误差,优于以往需要多项式对数或√T轮次的通信策略。

ABSTRACT

We consider speeding up stochastic gradient descent (SGD) by parallelizing it across multiple workers. We assume the same data set is shared among $n$ workers, who can take SGD steps and coordinate with a central server. Unfortunately, this could require a lot of communication between the workers and the server, which can dramatically reduce the gains from parallelism. The Local SGD method, proposed and analyzed in the earlier literature, suggests machines should make many local steps between such communications. While the initial analysis of Local SGD showed it needs $Ω( \sqrt{T} )$ communications for $T$ local gradient steps in order for the error to scale proportionately to $1/(nT)$, this has been successively improved in a string of papers, with the state-of-the-art requiring $Ω\left( n \left( \mbox{ polynomial in log } (T) ight) ight)$ communications. In this paper, we give a new analysis of Local SGD. A consequence of our analysis is that Local SGD can achieve an error that scales as $1/(nT)$ with only a fixed number of communications independent of $T$: specifically, only $Ω(n)$ communications are required.

研究动机与目标

  • 为解决在众多工作者之间扩展时并行SGD中的高通信成本问题。
  • 分析通信调度如何影响局部SGD中的收敛误差。
  • 设计一种在最小通信轮次下实现最优误差缩放的通信策略。
  • 证明仅需Ω(n)次通信即可在工作者数量上实现线性加速,且与T无关。
  • 改进先前工作,后者需要Ω(√T)或Ω(n poly-log(T))次通信轮次。

提出的方法

  • 提出一种动态通信间隔策略,通信间隔随迭代索引线性增长:H_i = 3(i+1)。
  • 在一般噪声模型下分析局部SGD,包括非独立同分布和非同分布数据。
  • 采用新颖的理论框架,对局部更新和通信延迟引入的残余误差进行上界估计。
  • 在强凸性和光滑性条件下,推导出收敛速率缩放为1/(nT),且误差仅依赖于n,不依赖于T。
  • 提出一种通信调度策略,优先在训练初期频繁平均,此时梯度较大且学习率较高。
  • 采用学习率序列η_t = 2/(μ(t+β)),以确保在所提策略下保持稳定性和收敛性。

实验结果

研究问题

  • RQ1局部SGD能否在与T无关的通信轮次下实现1/(nT)的最优误差缩放?
  • RQ2何种通信调度策略能在降低通信开销的同时最小化残余误差?
  • RQ3通信频率的选择如何影响非凸和强凸设置下的收敛性?
  • RQ4能否仅通过Ω(n)次通信实现工作者数量上的线性加速,而非多项式对数或√T轮次?
  • RQ5与固定或递增间隔相比,动态通信间隔策略在最终误差和通信效率方面是否表现更优?

主要发现

  • 所提通信策略仅需Ω(n)次通信轮次,即可实现O(1/(nT))的误差率,且与总迭代次数T无关。
  • 在通信受限条件下,该方法在瞬态误差和最终误差方面均优于固定间隔和早期递增间隔策略。
  • 数值实验表明,当R = n次通信时,局部SGD在不同网络规模下均实现线性加速,并匹配理论最优速率σ²/(μnT)。
  • 由于在训练初期梯度较大时通信频率更高,动态策略H_i = 3(i+1)比固定间隔更有效地降低早期阶段误差。
  • 与一次性平均相比,该方法在通信效率方面表现更优,后者虽在早期有通信优势,但最终误差更高。
  • 该分析在特殊情形(如恒定H)下恢复了当前最优的收敛速率,同时为广泛类别的噪声模型提供了通用理论框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。