Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Multi-GPU Parallelization Strategies for Deep Learning Training

Saptadeep Pal, Eiman Ebrahimi|arXiv (Cornell University)|Jul 30, 2019
Advanced Neural Network Applications参考文献 20被引用数 72
ひとこと要約

本稿では、スケーリング時にデータ並列性(DP)のスケーラビリティおよび統計的効率性の限界を克服するため、データ並列性(DP)とモデル並列性(MP)を組み合わせたハイブリッド多GPUトレーニング戦略を提案する。分析的フレームワークと、最適な演算子からデバイスへの配置を求めるための混合整数線形計画法ツールであるDLPlacerを用いて、インセプション-V3、GNMT、BigLSTMについてそれぞれ26.5%、8%、22%のエンドツーエンドトレーニング高速化を達成した。これは、DP単独よりも優れた性能を示している。

ABSTRACT

Deploying deep learning (DL) models across multiple compute devices to train large and complex models continues to grow in importance because of the demand for faster and more frequent training. Data parallelism (DP) is the most widely used parallelization strategy, but as the number of devices in data parallel training grows, so does the communication overhead between devices. Additionally, a larger aggregate batch size per step leads to statistical efficiency loss, i.e., a larger number of epochs are required to converge to a desired accuracy. These factors affect overall training time and beyond a certain number of devices, the speedup from leveraging DP begins to scale poorly. In addition to DP, each training step can be accelerated by exploiting model parallelism (MP). This work explores hybrid parallelization, where each data parallel worker is comprised of more than one device, across which the model dataflow graph (DFG) is split using MP. We show that at scale, hybrid training will be more effective at minimizing end-to-end training time than exploiting DP alone. We project that for Inception-V3, GNMT, and BigLSTM, the hybrid strategy provides an end-to-end training speedup of at least 26.5%, 8%, and 22% respectively compared to what DP alone can achieve at scale.

研究の動機と目的

  • GPU数の増加に伴うデータ並列トレーニングの収益逓減を是正すること、特に通信オーバーヘッドの増加と統計的効率性の低下によるもの。
  • 純粋なデータ並列性のスケーラビリティ限界を超えて、トレーニングスループットを維持または向上させるために、モデル並列性を導入する最適なタイミングを同定すること。
  • モデルアーキテクチャとハードウェア制約に基づいて、最良の並列化戦略(DP 対 ハイブリッド)を決定するための体系的フレームワークを構築すること。
  • モデル並列性の高速化を最大化するための最適な演算子からデバイスへの配置を求める、整数線形計画法に基づくツールであるDLPlacerを開発すること。
  • ハイブリッド並列化が多様な深層学習モデルにおいてエンドツーエンドトレーニング時間を顕著に短縮することを実証的に検証すること。

提案手法

  • 著者らは、データ並列性の性能劣化がモデル並列性による高速化を上回るクロスオーバー点を予測するための分析的モデルを構築した。
  • パイプライン処理とレイヤー間分割を用いて、Inception-V3、GNMT、BigLSTMの2ウェイモデル並列版を実装し、複数のGPUで並列実行を可能にした。
  • DLPlacerは、通信オーバーヘッドを最小限に抑え、並列性を最大化する目的で、演算子をデバイスに最適に配置するための整数線形計画法として導入された。
  • フレームワークは、異なるグローバルバッチサイズとデバイス数を想定し、純粋なDPとハイブリッドDP+MP戦略を比較して、トレーニング時間と収束性を評価した。
  • 実世界のモデルとハードウェア構成を用いてエンドツーエンドトレーニング高速化を予測し、Inception-V3での測定結果と照合して妥当性を検証した。

実験結果

リサーチクエスチョン

  • RQ1どの規模で、通信オーバーヘッドと統計的効率性の低下により、データ並列性単独のトレーニングスループットが低下し始めるか?
  • RQ2モデル並列性をどのように効果的にデータ並列性と組み合わせることで、スケーリングに伴うトレーニングスループットを維持または向上できるか?
  • RQ3通信コストを最小限に抑えながら、モデル並列性の高速化を最大限に引き出すための最適なデバイス配置戦略は何か?
  • RQ4与えられたモデルとハードウェア環境に対して、最良の並列化戦略(DP 対 ハイブリッド)を予測する体系的フレームワークは可能か?
  • RQ5多様な深層学習アーキテクチャにおいて、ハイブリッド並列化はデータ並列性単独と比較して、エンドツーエンドトレーニング時間をどの程度短縮できるか?

主な発見

  • インセプション-V3では、スケーリング時にデータ並列性単独と比較して、ハイブリッド戦略が少なくとも26.5%のエンドツーエンドトレーニング高速化を達成した。
  • GNMTでは、ハイブリッドアプローチが純粋なデータ並列性と比較して最低8%のエンドツーエンドトレーニング高速化を実現した。
  • BigLSTMでは、ハイブリッド戦略がデータ並列性と比較して、エンドツーエンドトレーニング時間を最低22%短縮した。
  • DLPlacerが予測したインセプション-V3のモデル並列性高速化(1.32倍)は、実測値と6%以内で一致し、配置最適化の精度が裏付けられた。
  • 本研究では、各モデルに対して、データ並列性の収益逓減がモデル並列性の高速化によって打ち消される一意のクロスオーバーポイントが同定され、最適なハイブリッド戦略選択が可能になった。
  • 結果として、純粋なデータ並列性が非効率になる一定数以上のGPUでスケーリングするためには、ハイブリッド並列化が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。