Skip to main content
QUICK REVIEW

[論文レビュー] Layer-wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees

Shaohuai Shi, Zhenheng Tang|arXiv (Cornell University)|Nov 20, 2019
Stochastic Gradient Optimization Techniques参考文献 36被引用数 14
ひとこと要約

本稿では、同期的SGDと階層別適応的勾配スパース化を組み合わせることで、パイipeliningによる通信-計算の重ね合わせを実現する分散ディープラーニング最適化手法LAGS-SGDを提案する。通信対計算比に基づき、各層ごとに顕著な勾配を適応的に選択することで、元のSGDと同等の収束速度を保ちながら通信オーバーヘッドを低減し、16-GPUクラスタ上での学習が密度型SGDに比べ最大30%高速化されることを示している。

ABSTRACT

To reduce the long training time of large deep neural network (DNN) models, distributed synchronous stochastic gradient descent (S-SGD) is commonly used on a cluster of workers. However, the speedup brought by multiple workers is limited by the communication overhead. Two approaches, namely pipelining and gradient sparsification, have been separately proposed to alleviate the impact of communication overheads. Yet, the gradient sparsification methods can only initiate the communication after the backpropagation, and hence miss the pipelining opportunity. In this paper, we propose a new distributed optimization method named LAGS-SGD, which combines S-SGD with a novel layer-wise adaptive gradient sparsification (LAGS) scheme. In LAGS-SGD, every worker selects a small set of "significant" gradients from each layer independently whose size can be adaptive to the communication-to-computation ratio of that layer. The layer-wise nature of LAGS-SGD opens the opportunity of overlapping communications with computations, while the adaptive nature of LAGS-SGD makes it flexible to control the communication time. We prove that LAGS-SGD has convergence guarantees and it has the same order of convergence rate as vanilla S-SGD under a weak analytical assumption. Extensive experiments are conducted to verify the analytical assumption and the convergence performance of LAGS-SGD. Experimental results on a 16-GPU cluster show that LAGS-SGD outperforms the original S-SGD and existing sparsified S-SGD without losing obvious model accuracy.

研究の動機と目的

  • パイipelニングと勾配スパース化を組み合わせることで、分散ディープラーニングにおける通信ボトルネックを解消すること。
  • モノリティックな勾配処理に起因する、通信と計算の重ね合わせができない既存のスパース化手法の限界を克服すること。
  • 通信-計算の重ね合わせを可能にしつつ収束保証を維持できる階層別適応的勾配スパース化方式を設計すること。
  • 弱い解析的仮定の下で、LAGS-SGDが通常のS-SGDと同等の収束速度の順序を保つことを理論的に証明すること。
  • 解析的仮定の妥当性を実証的に検証し、実世界のDNNにおいて優れた学習効率を示すこと。

提案手法

  • 各層ごとに勾配の大きさに基づき、独立に上位-kの顕著な勾配を選択する階層別適応的勾配スパース化(LAGS)方式を導入する。
  • 各層の通信対計算比に応じてスパース化比を動的に調整することで、負荷をバランスさせ、通信遅延を隠蔽する。
  • LAGSを同期的SGD(S-SGD)と統合してLAGS-SGDを構築し、バックプロパゲーションと通信が重複するパイipelンド実行を可能にする。
  • 過剰な勾配スパース化によるモデル精度の損失を防ぐために、誤差補償を採用する。
  • 弱い解析的仮定の下で、非凸滑らか最適化問題に対するLAGS-SGDの理論的収束境界を導出する。
  • 16-GPUクラスタ上での壁時計性能評価のため、HorovodとNCCLを用いたシステム実装を用いる。

実験結果

リサーチクエスチョン

  • RQ1階層別適応的勾配スパース化は、分散SGDにおける通信-計算の重ね合わせを可能にするか?
  • RQ2現実的な仮定の下で、LAGS-SGDは通常のS-SGDと同等の収束速度の順序を維持するか?
  • RQ3各層ごとの適応的圧縮比は、収束性と学習速度にどのように影響するか?
  • RQ4モデル精度を損なわず、密度型およびスパース化されたS-SGDに比べて顕著な高速化を達成できるか?
  • RQ5通信対計算比は、LAGS-SGDの性能にどのような影響を及えるか?

主な発見

  • 10GbEインターコネクトを備えた16-GPUクラスタ上、LAGS-SGDは密度型S-SGDに比べ最大30%高速な学習を達成した。
  • SLGS-SGDと比較して平均イテレーション時間を4.5%短縮し、システムスケーラビリティの向上を示した。
  • ImageNetでは、壁時計時間においてDense-SGDに比べ22%~30%の改善を達成した。
  • ResNet-20、VGG-16、ResNet-50モデルにおけるLAGS-SGDのTop-1精度は、Dense-SGDと0.3%以内の差に留まり、精度損失が最小限に抑えられた。
  • LSTM-PTBのパープレキシティはLAGS-SGDで109.4と、Dense-SGD(106.7)およびSLGS-SGD(105.7)に近く、収束の一貫性が確認された。
  • 理論的分析により、弱い解析的仮定の下でLAGS-SGDが通常のS-SGDと同等の収束速度の順序を持つことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。