Skip to main content
QUICK REVIEW

[論文レビュー] CROSSBOW: Scaling Deep Learning with Small Batch Sizes on Multi-GPU Servers

Alexandros Koliousis, Pijika Watcharapichat|arXiv (Cornell University)|Jan 8, 2019
Advanced Neural Network Applications参考文献 58被引用数 12
ひとこと要約

CROSSBOW は、小バッチサイズ(2–32)で学習する場合の高効率なハードウェア利用と最小限の統計的効率損失を実現する、単一サーバーで複数GPUを用いたディーブラーニングシステムである。これは、グローバルに一貫した平均モデルを用いて複数のモデルレプリカを同期的に調整する「同期的モデル平均化(SMA)」と、GPUあたりの同時学習者数を自動チューニングすることでスループットを最大化し、TensorFlowと比較して学習時間を最大4倍短縮することで達成される。

ABSTRACT

Deep learning models are trained on servers with many GPUs, and training must scale with the number of GPUs. Systems such as TensorFlow and Caffe2 train models with parallel synchronous stochastic gradient descent: they process a batch of training data at a time, partitioned across GPUs, and average the resulting partial gradients to obtain an updated global model. To fully utilise all GPUs, systems must increase the batch size, which hinders statistical efficiency. Users tune hyper-parameters such as the learning rate to compensate for this, which is complex and model-specific. We describe CROSSBOW, a new single-server multi-GPU system for training deep learning models that enables users to freely choose their preferred batch size - however small - while scaling to multiple GPUs. CROSSBOW uses many parallel model replicas and avoids reduced statistical efficiency through a new synchronous training method. We introduce SMA, a synchronous variant of model averaging in which replicas independently explore the solution space with gradient descent, but adjust their search synchronously based on the trajectory of a globally-consistent average model. CROSSBOW achieves high hardware efficiency with small batch sizes by potentially training multiple model replicas per GPU, automatically tuning the number of replicas to maximise throughput. Our experiments show that CROSSBOW improves the training time of deep learning models on an 8-GPU server by 1.3-4x compared to TensorFlow.

研究の動機と目的

  • マルチGPUサーバーで小バッチサイズでディープラーニングモデルを学習する場合の低効率なハードウェア利用を解決すること。
  • 通常、収束速度とモデル精度を低下させる小バッチサイズであっても、高い統計的効率を維持すること。
  • バッチサイズの増加を必要とせずに、複数GPUに効率的にスケーリングできるシステムを設計すること。
  • GPUあたりのモデルレプリカ数を自動的にチューニングして、ハードウェア利用率と学習スループットを最大化すること。
  • 新規の同期的モデル平均化プロトコルを通じて、最小限の統計的効率損失で高スループットの学習を実現すること。

提案手法

  • 複数のモデルレプリカが独立して勾配降下法を実行するが、グローバルに一貫した平均モデルを用いて更新を同期する新しい学習アルゴリズム「同期的モデル平均化(SMA)」を導入する。
  • 学習と同期のタスクを分離する階層的ツリー型タスクスケジューラを用い、同期がボトルネックとならないようにする。
  • スループットがピークに達するまでGPUあたりの同時学習者数を増加させることで、GPUあたりの同時学習者数を自動的にチューニングする。
  • SMAで動的補正を用いて平均モデルの収束速度と安定性を向上させる。
  • すべてのレプリカ間でグローバル平均モデルの強い一貫性を維持し、同期的かつ一貫性のある学習を保証する。
  • グローバルな同期バリアをツリー構造の階層に分解し、GPU上で学習と同期のタスクを効率的に並列実行可能にする。

実験結果

リサーチクエスチョン

  • RQ1小バッチサイズでマルチGPUサーバー上で学習するディープラーニングシステムは、統計的効率を損なわず、高効率なハードウェア利用を達成できるか?
  • RQ2小バッチサイズを用いる場合、複数GPUにまたがるモデルレプリカを効果的に同期する方法は何か?
  • RQ3スループットを最大化しながら一貫性を保つために、GPUあたりの最適なモデルレプリカ数は何か?
  • RQ4SMAのような同期学習法は、従来の非同期法やパラメータサーバー方式と比較して、速度と統計的効率の両面で優れているか?
  • RQ5GPUあたりの学習者数を自動チューニングすることで、学習スループットとスケーラビリティにどのような影響があるか?

主な発見

  • CROSSBOW は、8GPUサーバーで小バッチサイズを用いる場合、TensorFlowと比較して学習時間を最大4倍短縮する。
  • CROSSBOW は、ResNet や VGG などの複数のディープラーニングモデルにおいて、小バッチサイズ条件下で1.3–4倍の高速化を達成する。
  • SMA は、一貫した平均モデルを用いてモデルの軌道を同期的に補正することで、非同期法が遅延勾配に苦しむのとは対照的に、高い統計的効率を実現する。
  • GPUあたりの学習者数を自動チューニングすることで、ハードウェア利用率が向上し、手動設定なしにピークスループットが達成される。
  • 階層的タスクスケジューラにより、同期のボトルネックが回避され、GPU上で学習と同期のタスクを並列実行可能になる。
  • CROSSBOW は、すべてのレプリカ間で平均モデルの強い一貫性を維持し、多数の同時学習者を伴っても信頼性があり安定した学習を保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。