Skip to main content
QUICK REVIEW

[论文解读] Demystifying Why Local Aggregation Helps: Convergence Analysis of Hierarchical SGD

Jiayi Wang, Shiqiang Wang|arXiv (Cornell University)|Oct 24, 2020
Energy Efficient Wireless Sensor Networks被引用 5
一句话总结

本文通过引入'上行'和'下行'发散来对分层随机梯度下降(H-SGD)进行新颖的收敛性分析,解释了为何在非独立同分布(non-IID)、非凸及随机设置下,局部聚合能提升训练效果。研究证明,H-SGD的收敛上界介于两种单层局部SGD设置之间——展现出一种'夹心行为',为分层聚合如何缓解数据异质性并提升全局收敛性提供了理论洞见。

ABSTRACT

Hierarchical SGD (H-SGD) has emerged as a new distributed SGD algorithm for multi-level communication networks. In H-SGD, before each global aggregation, workers send their updated local models to local servers for aggregations. Despite recent research efforts, the effect of local aggregation on global convergence still lacks theoretical understanding. In this work, we first introduce a new notion of "upward" and "downward" divergences. We then use it to conduct a novel analysis to obtain a worst-case convergence upper bound for two-level H-SGD with non-IID data, non-convex objective function, and stochastic gradient. By extending this result to the case with random grouping, we observe that this convergence upper bound of H-SGD is between the upper bounds of two single-level local SGD settings, with the number of local iterations equal to the local and global update periods in H-SGD, respectively. We refer to this as the "sandwich behavior". Furthermore, we extend our analytical approach based on "upward" and "downward" divergences to study the convergence for the general case of H-SGD with more than two levels, where the "sandwich behavior" still holds. Our theoretical results provide key insights of why local aggregation can be beneficial in improving the convergence of H-SGD.

研究动机与目标

  • 从理论上理解在非IID数据、非凸目标函数和随机梯度下,H-SGD中局部聚合为何能改善收敛性。
  • 解决在存在数据异质性和通信效率约束的现实分布式设置中,H-SGD缺乏理论分析的问题。
  • 通过'上行'和'下行'发散来表征数据异质性,从而实现对分层级别间模型发散的精细化分析。
  • 建立H-SGD的收敛上界,揭示多级聚合的根本优势。
  • 将分析扩展至多级H-SGD,并证明'夹心行为'在多个层级中依然成立。

提出的方法

  • 提出一种基于'上行'和'下行'发散的新理论框架,用于分解H-SGD中的全局模型发散。
  • 在非IID数据、非凸目标函数和随机梯度下,推导两级H-SGD的最坏情况收敛上界。
  • 将分析扩展至随机分组场景,以证明收敛上界的鲁棒性与泛化能力。
  • 证明H-SGD的收敛上界严格介于两种单层局部SGD设置的上界之间,其局部和全局更新周期分别为I和G——即定义为'夹心行为'。
  • 将基于发散的分析推广至多级H-SGD(M ≥ 3级),证明'夹心行为'在高阶层次结构中依然成立。
  • 利用该框架分析部分工作者参与和不同分组规模下的性能,通过实验验证理论洞见。

实验结果

研究问题

  • RQ1为何在非IID数据和随机梯度下,H-SGD中的局部聚合仍能改善收敛性?
  • RQ2在不同聚合周期下,H-SGD的收敛性与单层局部SGD相比如何?
  • RQ3是否能从理论上证明并推广'夹心行为'——即H-SGD收敛性介于两种局部SGD模式之间——至多级系统?
  • RQ4'上行'和'下行'发散在表征分层通信层级间模型发散方面起到何种作用?
  • RQ5在随机分组和部分工作者参与的情况下,局部聚合的理论优势是否依然成立?

主要发现

  • 所提出的H-SGD收敛上界在非IID数据、非凸目标函数和随机梯度下,比以往工作更紧致且更具普适性,后者或假设IID数据,或使用全批量梯度。
  • H-SGD的收敛上界严格介于两种单层局部SGD设置的上界之间,其聚合周期分别为I和G——此现象被称为'夹心行为'。
  • '夹心行为'在多级H-SGD(M ≥ 3)中依然存在,表明分层聚合相较于单层方法具有系统性改进。
  • 即使在随机分组下,H-SGD的收敛上界仍保持有界,并介于两种局部SGD模式之间,表明其对分组策略具有鲁棒性。
  • 在FEMNIST、CelebA和CIFAR-10上的实验表明,与单层局部SGD相比,采用多级聚合的H-SGD在测试准确率更高、训练损失更低,尤其在高通信延迟下表现更优。
  • 在全局周期更大的3级H-SGD设置中(如P₁=200, P₂=40, P₃=20),性能优于全局周期更小的单层H-SGD,表明分层聚合可在不牺牲收敛性的情况下降低通信成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。