Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Restarted SGD with Faster Convergence and Less Communication: Demystifying Why Model Averaging Works for Deep Learning

Hao Yu, Sen Yang|arXiv (Cornell University)|Jul 17, 2018
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本稿では、分散型ディープラーニングにおけるモデルアveragingが、通信回数を削減しながらも高速収束を達成する理由を説明する理論的枠組みとして、Parallel Restarted SGDを提案する。定期的にワーカー間でモデルをアveragingし、SGDを再起動することで、並列ミニバッチSGDと同等のO(1/√(NT))の収束速度を達成しながら、通信ラウンド数をO(T^{1/4})削減する。非凸最適化において、通信頻度を低くするアプローチが効果的かつ効率的であることが示された。

ABSTRACT

In distributed training of deep neural networks, parallel mini-batch SGD is widely used to speed up the training process by using multiple workers. It uses multiple workers to sample local stochastic gradient in parallel, aggregates all gradients in a single server to obtain the average, and update each worker's local model using a SGD update with the averaged gradient. Ideally, parallel mini-batch SGD can achieve a linear speed-up of the training time (with respect to the number of workers) compared with SGD over a single worker. However, such linear scalability in practice is significantly limited by the growing demand for gradient communication as more workers are involved. Model averaging, which periodically averages individual models trained over parallel workers, is another common practice used for distributed training of deep neural networks since (Zinkevich et al. 2010) (McDonald, Hall, and Mann 2010). Compared with parallel mini-batch SGD, the communication overhead of model averaging is significantly reduced. Impressively, tremendous experimental works have verified that model averaging can still achieve a good speed-up of the training time as long as the averaging interval is carefully controlled. However, it remains a mystery in theory why such a simple heuristic works so well. This paper provides a thorough and rigorous theoretical study on why model averaging can work as well as parallel mini-batch SGD with significantly less communication overhead.

研究の動機と目的

  • 分散型ディープラーニングにおけるモデルアveragingが、並列ミニバッチSGDと比較して著しく通信回数を減らしながらも高速収束を達成する理由を理論的に説明すること。
  • 非凸最適化設定下で、異種ワーカーを想定したモデルアveragingの収束挙動を分析すること。
  • 分散学習における通信削減と収束速度のトレードオフを定量化すること。
  • 再起動機構を用いることで、同期頻度が低下しても、ワーカー数に対する線形スケーリングを維持できるかどうかを確立すること。

提案手法

  • モデルアveragingの形式的定式化として、Parallel Restarted SGD (PR-SGD) を提案。ワーカーはI反復分ローカルSGDを実行後、モデルをアveragingする。
  • 再起動機構を導入。平均モデルを次エポックの初期化として用いることで、誤差の蓄積を低減する。
  • 非凸設定下での収束誤差を抑えられるよう、ワーカーおよびエポック間の重み付き勾配平均を用いる。
  • 滑らかさ、分散の有界性、Lipschitz勾配といった標準仮定の下で、同種および異種ワーカー設定の両方において理論的収束バウンドを導出する。
  • 標準的な並列SGDと比較して、同期ラウンド数をO(T^{1/4})に削減することで、通信コストを分析する。
  • 収束と通信のバランスを取るために、ステップサイズγ = Θ(√N / √T)およびアveraging間隔I_i = Θ(T^{1/4}/N^{3/4})を採用する。

実験結果

リサーチクエスチョン

  • RQ1なぜモデルアveragingは通信頻度を減らしてもディープラーニングで高速収束を達成できるのか?
  • RQ2通信回数を減らしても、モデルアveragingは並列ミニバッチSGDと同等のO(1/√(NT))の収束速度を維持できるか?
  • RQ3モデルアveragingの頻度は、異種分散学習における収束にどのように影響するか?
  • RQ4分散非凸最適化において、通信コストと収束速度の理論的トレードオフは何か?
  • RQ5モデルアveragingにおける再起動機構は、初期値が悪い場合でも収束を改善できるか?

主な発見

  • Parallel Restarted SGDによるモデルアveragingは、並列ミニバッチSGDと同等のO(1/√(NT))の収束速度を達成し、ワーカー数に対する線形スケーリングを維持する。
  • 通信ラウンド数が、標準的な並列ミニバッチSGDと比較してO(T^{1/4})削減され、通信オーバーヘッドが顕著に低減される。
  • ワーカー固有のアveraging間隔I_i = Θ(T^{1/4}/N^{3/4})を用いることで、異種ワーカー設定下でも収束を維持する。
  • 理論的分析により、初期点が悪くても再起動機構によって補われ、特に異種設定下で初期段階の収束が速くなることが示された。
  • CIFAR10のResNet20を用いた実験では、I ∈ {4,8,16,32}のモデルアveragingが、通信量を減らしながらも並列ミニバッチSGD(I=1)と同等またはそれを上回る性能を達成した。
  • 画像分類や音声認識を含むさまざまなディープラーニングタスクにおいて、本手法は頑健であり、先行の実験的評価でも裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。