[論文レビュー] Dynamic Stale Synchronous Parallel Distributed Training for Deep Learning
本稿では、ディープラーニングの分散学習のための新しい分散トレーニングパラダイムである動的遅延同期並列(DSSP)を提案する。DSSPは、ワーカーの処理時間に基づいて実行時に遅延しきい値を動的に調整することで、手動によるハイパーパrameterチューニングの必要性を排除する。DSSPは、同期待ち時間を短縮しつつ収束の保証を維持することで、収束速度と精度を向上させ、特に異種GPU環境において優れた性能を発揮する。DSSPは、SSP、BSP、ASPを凌駕し、安定性とパフォーマンスの両面で優れている。
Deep learning is a popular machine learning technique and has been applied to many real-world problems. However, training a deep neural network is very time-consuming, especially on big data. It has become difficult for a single machine to train a large model over large datasets. A popular solution is to distribute and parallelize the training process across multiple machines using the parameter server framework. In this paper, we present a distributed paradigm on the parameter server framework called Dynamic Stale Synchronous Parallel (DSSP) which improves the state-of-the-art Stale Synchronous Parallel (SSP) paradigm by dynamically determining the staleness threshold at the run time. Conventionally to run distributed training in SSP, the user needs to specify a particular staleness threshold as a hyper-parameter. However, a user does not usually know how to set the threshold and thus often finds a threshold value through trial and error, which is time-consuming. Based on workers' recent processing time, our approach DSSP adaptively adjusts the threshold per iteration at running time to reduce the waiting time of faster workers for synchronization of the globally shared parameters, and consequently increases the frequency of parameters updates (increases iteration throughput), which speedups the convergence rate. We compare DSSP with other paradigms such as Bulk Synchronous Parallel (BSP), Asynchronous Parallel (ASP), and SSP by running deep neural networks (DNN) models over GPU clusters in both homogeneous and heterogeneous environments. The results show that in a heterogeneous environment where the cluster consists of mixed models of GPUs, DSSP converges to a higher accuracy much earlier than SSP and BSP and performs similarly to ASP. In a homogeneous distributed cluster, DSSP has more stable and slightly better performance than SSP and ASP, and converges much faster than BSP.
研究の動機と目的
- 遅延同期並列(SSP)トレーニングにおける最適な遅延しきい値を手動で選択する課題に対処すること。これは時間のかかる作業であり、しばしば最適でない。
- 分散ディープラーニングにおいて、高速なワーカーの同期待ち時間を短縮するために、リアルタイムでのワーカー性能に基づいて実行時に遅延しきい値を動的に調整すること。
- GPUの処理能力に顕著な差がある異種環境でも、トレーニングの収束速度と精度を向上させること。
- BSP、ASP、SSPといった既存のパラダイムと比較して、理論的収束保証を維持しつつ、実用的な柔軟性と安定性を向上させること。
- システムの非均一性に関する事前知識が不要な、軽量で適応可能なメカニズムを提供すること。
提案手法
- DSSPは、各イテレーションにおいてワーカーごとにリアルタイムの処理時間測定値を用いて、そのワーカーの遅延しきい値を動的に決定する。
- アルゴリズムは、最近の処理時間に基づいて各ワーカーごとに局所的遅延しきい値 $ s_L $ を計算し、これにより高速ワーカーは遅いワーカーの到着を過ぎたとしても、動的に調整された制限を超えない範囲で待たずに進める。
- 全ワーカー全体の最大許容遅延を制限するためのグローバルしきい値 $ r $ が用いられ、収束の安定性が保証される。
- 本手法はパラメータサーバー枠組みと統合されており、ワーカーは勾配をプッシュし、更新されたグローバル重みをプルする。同期は動的しきい値によって制御される。
- 本手法は、再トレーニングやハイパーパrameter探索を伴わない、軽量なランタイム適応メカニズムを用いる。
- 理論的分析により、DSSPはSSPのレジレットバウンドを継承しており、しきい値範囲が一定の間は収束保証が得られることを示している。
実験結果
リサーチクエスチョン
- RQ1SSPにおける遅延しきい値を実行時に自動的に決定することで、手動チューニングの負担を軽減できるか?
- RQ2動的しきい値調整は、異種GPUクラスタにおける収束速度と精度を向上させることができるか?
- RQ3DSSPは、均一および非均一環境において、BSP、ASP、SSPと比較してトレーニング速度、精度、安定性の点で優れているか?
- RQ4全結合層の影響は、異なる分散パラダイムの収束トレンドにどのように現れるか?
- RQ5DSSPは、ネットワーク状態が変動する状況や、ワーカーの速度が不安定な状況でも高いパフォーマンスを維持できるか?
主な発見
- GTX1060とGTX1080 Tiからなる非均一GPUクラスタにおいて、DSSPは3046.3秒で0.68のテスト精度に収束した。これは、$ s=15 $ としたSSPが7255.6秒を要したのと比べて顕著に高速であった。
- 非均一環境では、DSSPはSSPとBSPよりも高いテスト精度を達成した。一方、ASPは最も速かったが、遅延が多すぎたため、低い精度に収束した。
- 均一クラスタでは、DSSPはSSPとASPよりもより安定的かつわずかに優れた性能を示し、BSPよりもはるかに速く収束した。
- DSSPは3016.4秒で0.67の精度に到達し、ASPの速度を同等に達成したが、より高い精度と収束安定性を維持した。
- CIFAR-100におけるResNet-110では、DSSPは$ s=3 $ としたSSPを上回り、最適なしきい値でチューニングされたSSPですら、より高い精度をより速く達成した。
- 結果から、DSSPは、ASPが非均一環境で高い遅延に苦しむのとは対照的に、さまざまなハードウェア構成において一貫したパフォーマンスを維持していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。