Skip to main content
QUICK REVIEW

[論文レビュー] MG-WFBP: Efficient Data Communication for Distributed Synchronous SGD Algorithms

Shaohuai Shi, Xiaowen Chu|arXiv (Cornell University)|Nov 27, 2018
Stochastic Gradient Optimization Techniques参考文献 25被引用数 4
ひとこと要約

本稿では、通信起動オーバーヘッドを低減するために層間の小さな勾配メッセージを統合する、分散同期SGD向けに最適化された通信スケジューリングアルゴリズムMG-WFBPを提案する。訓練イテレーション時間の最小化という最適化問題として定式化することで、64ノードのGPUクラスタ上でのWFBPおよびSyncEASGDと比較して最大1.75倍の高速化を達成し、通信量と計算量の比が高い状況においてスケーリング効率を顕著に向上させた。

ABSTRACT

Distributed synchronous stochastic gradient descent has been widely used to train deep neural networks on computer clusters. With the increase of computational power, network communications have become one limiting factor on system scalability. In this paper, we observe that many deep neural networks have a large number of layers with only a small amount of data to be communicated. Based on the fact that merging some short communication tasks into a single one may reduce the overall communication time, we formulate an optimization problem to minimize the training iteration time. We develop an optimal solution named merged-gradient WFBP (MG-WFBP) and implement it in our open-source deep learning platform B-Caffe. Our experimental results on an 8-node GPU cluster with 10GbE interconnect and trace-based simulation results on a 64-node cluster both show that the MG-WFBP algorithm can achieve much better scaling efficiency than existing methods WFBP and SyncEASGD.

研究の動機と目的

  • 高速GPUを搭載した高帯域幅クラスタにおいて、通信量と計算量の比が高い状況で顕著に現れる、分散ディープラーニングの性能ボトルネックを解消すること。
  • WFBP や SyncEASGD といった既存手法が、高い起動コストを伴う小さな頻繁な勾配転送を非効率に処理していることの特定。
  • 計算-計算のオーバーラップと通信効率を考慮した、総訓練イテレーション時間を最小化する最適化問題として通信スケジューリング問題を定式化すること。
  • 通信と計算の重ね合わせを最適化し、知的なメッセージ統合によって通信総時間を最小化する、グローバルに効率的な通信戦略の開発。
  • 最先端の通信手法と比較して、実際およびシミュレートされた大規模GPUクラスタにおけるMG-WFBPのスケーラビリティと性能向上を実証すること。

提案手法

  • 層ごとの計算および通信コストを考慮し、訓練イテレーション時間の最小化を目的とした通信スケジューリング問題を定式化する。
  • MG-WFBP(Merged-Gradient Wait-Free Backpropagation)を提案する。このアルゴリズムは、層間の小さな勾配通信を統合してより大きな効率的なメッセージにすることで、ネットワーク起動オーバーヘッドを低減する。
  • L層の最適な統合スケジュールを計算する動的計画法に基づく解法を設計し、時間計算量O(L²)を達成。この計算はトレーニング開始前に一度だけ実行される。
  • MG-WFBPをオープンソースのB-Caffeディープラーニングプラットフォームに統合し、最適化された通信を備えたエンドツーエンドの分散トレーニングを可能にする。
  • 待機不要バックプロパゲーションの原則を活用し、勾配が利用可能になった段階ですぐに通信を開始できるようにしつつ、統合されたメッセージが計算を遅らせないよう保証する。
  • 64ノードのクラスタを対象としたトレースベースのシミュレーションにより、物理的ハードウェアの制限を超えたスケーラビリティを評価し、多数ノード環境下での性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1層間の小さな頻繁な勾配通信を統合することで、分散同期SGDにおける総訓練イテレーション時間の短縮が可能か?
  • RQ2通信量と計算量の比が高い状況でネットワーク起動コストが支配的になると、待機不要バックプロパゲーション(WFBP)戦略は非効率的になるか?
  • RQ3高い起動コストを伴う大規模クラスタでは、シングルレイヤー通信アプローチであるSyncEASGDがWFBPを上回る性能を発揮するか?
  • RQ4通信と計算のオーバーラップと、メッセージ統合による通信総時間の最小化の間で、最適なトレードオフは何か?
  • RQ5グローバルに最適な通信スケジューリング戦略が存在し、レイヤー単位およびシングルレイヤー通信手法を上回るスケーリング効率を実現できるか?

主な発見

  • 10GbEインターコネクトを備えた8ノードGPUクラスタ上では、MG-WFBPはWFBPに対して最大1.36倍、SyncEASGDに対して最大1.2倍の高速化を達成した。
  • 64ノードクラスタのトレースベースシミュレーションでは、MG-WFBPはWFBPに対して1.7倍以上、SyncEASGDに対して1.3倍以上の高速化を達成した。
  • ResNet-50のトレーニングにおいて、64ノードのシミュレーテッド環境ではMG-WFBPはWFBPに対して約1.75倍、SyncEASGDに対して約1.45倍の高速化を達成した。
  • MG-WFBPは64ノードクラスタで70%を超える優れたスケーリング効率を維持したが、WFBPおよびSyncEASGDは通信起動オーバーヘッドが隠れていないため、約55%まで低下した。
  • シミュレーションで観察されたWFBPとSyncEASGDの性能クロスオーバーは、WFBPが小さなクラスタではオーバーラップの恩恵を受けるが、大規模環境では起動コストの低減によりSyncEASGDおよびMG-WFBPが優れていることを確認した。
  • MG-WFBPの最適なメッセージ統合戦略により、ネットワーク帯域幅の効率的活用とアイドル時間の削減が可能となり、通信量と計算量の比が高い状況下で最もスケーラブルなソリューションとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。