Skip to main content
QUICK REVIEW

[論文レビュー] Characterizing and Modeling Distributed Training with Transient Cloud GPU Servers

Shijian Li, Robert J. Walls|arXiv (Cornell University)|Apr 7, 2020
Advanced Neural Network Applications参考文献 37被引用数 4
ひとこと要約

本論文は、一時的クラウドGPUサーバーにおける分散学習のパフォーマンスを特徴づけ、予測する大規模な実験的調査およびモデリングフレームワーク、CM-DAREを提案する。20のCNN、3種類のGPUタイプ、6地域の測定結果を用いて、回帰ベースのモデルが、平均絶対誤差が3.4%未満で学習速度と障害耐性のオーバーヘッドを予測できることを示し、過負荷のパラメータサーバーのようなパフォーマンスボトルネックの特定を可能にする。

ABSTRACT

Cloud GPU servers have become the de facto way for deep learning practitioners to train complex models on large-scale datasets. However, it is challenging to determine the appropriate cluster configuration---e.g., server type and number---for different training workloads while balancing the trade-offs in training time, cost, and model accuracy. Adding to the complexity is the potential to reduce the monetary cost by using cheaper, but revocable, transient GPU servers. In this work, we analyze distributed training performance under diverse cluster configurations using CM-DARE, a cloud-based measurement and training framework. Our empirical datasets include measurements from three GPU types, six geographic regions, twenty convolutional neural networks, and thousands of Google Cloud servers. We also demonstrate the feasibility of predicting training speed and overhead using regression-based models. Finally, we discuss potential use cases of our performance modeling such as detecting and mitigating performance bottlenecks.

研究の動機と目的

  • 一時的クラウドGPUサーバーにおける分散学習のパフォーマンス特性を理解すること。これらは安価であるが、予期しない停止のリスクを有する。
  • 異種かつ一時的なクラスタ構成における学習速度および障害耐性オーバーヘッドに影響を与える要因を特定すること。
  • 実世界のクラウド環境における学習スループットおよびオーバーヘッドを予測する、正確でデータ駆動型のパフォーマンスモデルを開発すること。
  • 学習中にパフォーマンスボトルネックを検出し、緩和するといった実用的応用を可能にすること。
  • CM-DAREを構築し、オープンソース化することで、障害耐性の向上と一時的対応の分散学習を支援する測定および学習フレームワークを提供すること。

提案手法

  • TensorFlowおよびTensor2Tensorを拡張し、障害耐性および監視に向けた一時的対応最適化を備えたクラウドベースの測定および学習フレームワークであるCM-DAREを構築した。
  • 20の畳み込みニューラルネットワーク、3種類のGPUタイプ(T4、V100、P100)、6地域のGoogleクラウドで大規模な実験を実施し、学習速度、リボーカル時間、オーバーヘッドメトリクスを収集した。
  • クラスタサイズ、GPUタイプ、モデルの複雑さなどの特徴を用いて、学習速度および障害耐性オーバーヘッドを予測する回帰ベースのモデルを開発した。
  • 30秒のウォームアップ期間と6.7%の速度差異のしきい値を用いた動的ボトルネック検出メカニズムをCM-DAREに実装した。
  • 平均絶対誤差(MAPE)を用いてモデルの精度を評価し、学習速度予測で最低3.4%の低誤差を達成した。
  • サーバーのリボーカル時にデータ損失や再起動オーバーヘッドを低減するため、一時的対応のチェックポイントおよび回復メカニズムを設計・統合した。

実験結果

リサーチクエスチョン

  • RQ1クラスタの異種性(異なるGPUタイプ)が、一時的クラウドサーバーにおける分散学習パフォーマンスにどのように影響するか?
  • RQ2回帰ベースのモデルは、一時的クラウドGPUクラスタにおける学習速度および障害耐性オーバーヘッドをどの程度正確に予測できるか?
  • RQ3一時的サーバーにおける分散学習の主なパフォーマンスボトルネックは何か、そしてリアルタイムでどのように検出できるか?
  • RQ4パラメータサーバーの数を増やすことで、異種クラスタにおける学習速度およびスケーラビリティにどのような影響があるか?
  • RQ5正確なパフォーマンスモデルは、クラウドベースのディープラーニングワークロードにおける学習非効率の事前緩和を可能にするか?

主な発見

  • 異種クラスタにおける学習速度は、個々のサーバー速度の和にほぼ等しく、最適な条件下ではほぼ線形的なスケーラビリティを示す。
  • 回帰モデルは、学習速度予測において平均絶対誤差(MAPE)が最低3.4%まで低下し、実世界への導入において高い正確性を示した。
  • モデルのチェックポイントによる障害耐性オーバーヘッドは高い精度で予測可能であり、学習時間の予測に統合することで、コストおよび時間の見積もりを改善できる。
  • 過負荷のパラメータサーバーはスケーラビリティを顕著に制限する。1つのパラメータサーバーから2つに増やすことで、大規模クラスタでは学習速度が最大70.6%向上した。
  • CM-DAREは、予測された学習速度と測定された学習速度を比較することで、リアルタイムにパフォーマンスボトルネックを検出し、早期干渉を可能にした。
  • フレームワークおよびデータセットは公開されており、再現性および一時的分散学習最適化分野における今後の研究を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。