Skip to main content
QUICK REVIEW

[論文レビュー] On the Acceleration of Deep Learning Model Parallelism with Staleness

An Xu, Zhouyuan Huo|arXiv (Cornell University)|Sep 5, 2019
Advanced Neural Network Applications被引用数 7
ひとこと要約

本稿では、Diversely Stale Parameters (DSP) を提案する。これは、バックプロパゲーションにおける前方、後方、更新のロックを解消するために、層別に遅延を導入することで、分散DNN学習における深層学習の学習を高速化する、新しいモデル並列化手法である。下位層が遅延した勾配を使用し、前方パスと再計算を重ねることで、精度の損失やメモリの増加を伴わずに顕著な高速化を達成し、SGDおよびモーメンタムSGDの下で非凸問題に対して収束を理論的に保証する。

ABSTRACT

Training the deep convolutional neural network for computer vision problems is slow and inefficient, especially when it is large and distributed across multiple devices. The inefficiency is caused by the backpropagation algorithm's forward locking, backward locking, and update locking problems. Existing solutions for acceleration either can only handle one locking problem or lead to severe accuracy loss or memory inefficiency. Moreover, none of them consider the straggler problem among devices. In this paper, we propose Layer-wise Staleness and a novel efficient training algorithm, Diversely Stale Parameters (DSP), to address these challenges. We also analyze the convergence of DSP with two popular gradient-based methods and prove that both of them are guaranteed to converge to critical points for non-convex problems. Finally, extensive experimental results on training deep learning models demonstrate that our proposed DSP algorithm can achieve significant training speedup with stronger robustness than compared methods.

研究の動機と目的

  • バックプロパゲーションにおける前方、後方、更新のロックによって引き起こされるモデル並列化の非効率性を解消すること。
  • 精度の損失、メモリの増加、または遅延するデバイス(stragglers)の処理ができないという制限を抱える先行手法の限界を克服すること。
  • 細かく粒度の細かい、層固有の遅延を導入することで、デバイス間で非同期学習を効率的に行えるようにすること。
  • SGDおよびモーメンタムSGDの下で非凸最適化に対して収束の理論的保証を提供すること。
  • 分散学習環境において、顕著な高速化と遅延するデバイスに対する頑健性を実証的に示すこと。

提案手法

  • 異なるネットワークブロックが異なる学習ステップの勾配を使用できる、細かく粒度の細かい遅延メカニズム「層別遅延」を提案する。
  • 下位層がより遅れた勾配を使用するため、独立的かつ非同期的な更新が可能な、訓練アルゴリズム「Diversely Stale Parameters (DSP)」を導入する。
  • 中間活性化の再計算を前方パスと重ねることで、すべての中間結果を保存する必要を回避し、メモリ消費量を削減する。
  • 合成勾配と遅延した誤差伝搬を用いて、後方パスと前方パスを分離し、後方および前方のロックを排除する。
  • リャプノフ関数と確率的勾配降下法(SGD)にモーメンタムを組み合わせた収束分析フレームワークを用い、臨界点への収束を証明する。
  • 層ごとに異なる遅延レベルを考慮した、変更された勾配更新ルールを適用し、安定性と収束性を保証する。

実験結果

リサーチクエスチョン

  • RQ1層別遅延を導入することで、モデル並列DNN学習における前方、後方、更新のロックを解消できるか?
  • RQ2非凸設定下でも、遅れた勾配を使用しているにもかかわらず、提案されたDSPアルゴリズムが学習の収束性と精度を維持できるか?
  • RQ3DSPは、メモリ使用量の増加やモデル性能の低下を伴わずに顕著な高速化を達成できるか?
  • RQ4分散学習環境において、DSPは遅延するデバイスに対してどれほど頑健か?
  • RQ5層ごとに異なる遅延レベルを用いる場合、収束に対する理論的保証はどのようなものか?

主な発見

  • DSPは、GPipe や DDG といったベースライン手法と比較して顕著な学習高速化を達成し、精度の低下がない。
  • 本手法は、ランダムな遅延するデバイスに対しても強く頑健であり、非同期実行下でも安定した収束を維持する。
  • 理論的分析により、DSPは標準SGDおよびモーメンタムSGDの下で、非凸問題に対して臨界点への収束を保証することが証明された。
  • 前方パスと再計算を重ねることで、メモリ消費量が削減され、すべての中間活性化を保存する必要がなくなる。
  • 実験的結果から、DSPは深層畳み込みニューラルネットワーク(CNN)において、学習スループットとスケーラビリティの点で既存手法を上回ることが示された。
  • 収束の境界は遅延レベルと学習率に依存し、制御された遅延と最適なハイパーパramータを用いることで、よりタイトな境界が達成できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。