Skip to main content
QUICK REVIEW

[論文レビュー] Characterizing Deep Learning Training Workloads on Alibaba-PAI

Mengdi Wang, Chen Meng|arXiv (Cornell University)|Oct 14, 2019
Advanced Neural Network Applications参考文献 48被引用数 5
ひとこと要約

本論文は、アリババ-PAIにおけるディープラーニング学習ワークロードの特性を把握するための軽量な分析フレームワークを提示する。通信オーバーヘッドが主なボトルneckであることが特定された。多様なワークロードにおける実行時間のモデル化により、平均して重み/勾配の通信が全学習時間の62%を占めていることが判明。100 Gbpsイーサーネットを導入することで1.7倍の高速化が可能であり、PS/Workerワークロードの60%がNVLinkを搭載したAllReduceに移行することで著しい高速化が見込める。

ABSTRACT

Modern deep learning models have been exploited in various domains, including computer vision (CV), natural language processing (NLP), search and recommendation. In practical AI clusters, workloads training these models are run using software frameworks such as TensorFlow, Caffe, PyTorch and CNTK. One critical issue for efficiently operating practical AI clouds, is to characterize the computing and data transfer demands of these workloads, and more importantly, the training performance given the underlying software framework and hardware configurations. In this paper, we characterize deep learning training workloads from Platform of Artificial Intelligence (PAI) in Alibaba. We establish an analytical framework to investigate detailed execution time breakdown of various workloads using different training architectures, to identify performance bottleneck. Results show that weight/gradient communication during training takes almost 62% of the total execution time among all our workloads on average. The computation part, involving both GPU computing and memory access, are not the biggest bottleneck based on collective behavior of the workloads. We further evaluate attainable performance of the workloads on various potential software/hardware mappings, and explore implications on software architecture selection and hardware configurations. We identify that 60% of PS/Worker workloads can be potentially sped up when ported to the AllReduce architecture exploiting the high-speed NVLink for GPU interconnect, and on average 1.7X speedup can be achieved when Ethernet bandwidth is upgraded from 25 Gbps to 100 Gbps.

研究の動機と目的

  • アリババのPAIプラットフォーム上で実行される実世界のディープラーニング学習ワークロードにおける性能ボトルneckを理解すること。
  • 大規模AIクラスタにおいて、計算、メモリアクセス、通信のうち、どれが性能を支配しているかを特定すること。
  • 分析的モデルを用いて、異なるソフトウェア/ハードウェア構成による性能向上を予測すること。
  • ワークロードの特性に基づいて、システムアーキテクチャ設計とハードウェア調達意思決定を支援すること。

提案手法

  • 生産環境の数千件のトレーニングジョブから実行時メトリクスを収集する軽量なプロファイリングフレームワークを採用。
  • ワークロードの実行時間を計算、データI/O、重み/勾配通信の各フェーズに分解。
  • 主要なワークロード特徴量を用いて分析的性能モデルを構築し、異なるシステム構成下での挙動を予測。
  • PS/WorkerアーキテクチャとAllReduceアーキテクチャの代替構成、およびネットワーク帯域幅(例:25 Gbpsから100 Gbps)やNVLinkなどのハードウェア変更による性能向上をモデルで予測。
  • テストベッド実験を用いた事例研究により、モデルの正確性を検証。推定値と実測値の平均誤差は10%未満であることを確認。
  • 混合精度学習やXLA演算統合といった最適化技術を、ワークロード固有のボトルneckを踏まえて評価。

実験結果

リサーチクエスチョン

  • RQ1アリババ-PAI上での実世界のディープラーニング学習ワークロードにおける主な性能ボトルneckは何か?
  • RQ2通信オーバーヘッド、特に重み/勾配の転送は、計算やI/Oと比較して実行時間にどの程度影響を与えるか?
  • RQ3高速GPU相互接続を備えたAllReduceアーキテクチャにPS/Workerから移行することで、どの程度の性能向上が得られるか?
  • RQ4ネットワーク帯域幅を25 Gbpsから100 Gbpsにアップグレードすることで、さまざまなワークロードにおけるトレーニング性能にどのような影響があるか?
  • RQ5分析的モデルは、システム構成変更に伴う実際の性能向上をどの程度正確に予測できるか?

主な発見

  • 重み/勾配通信は、すべてのワークロードで平均して全学習時間の62%を占めており、主な性能ボトルneckである。
  • 高いGPU利用率にもかかわらず、計算やメモリアクセスは主なボトルneckではないことが判明。通信が主な制約要因である。
  • 25 Gbpsから100 Gbpsイーサーネットにアップグレードすることで、ワークロード全体で平均1.7倍の高速化が達成可能。
  • PS/Workerワークロードの60%が、NVLink搭載GPU相互接続を備えたAllReduceに移行することで顕著な高速化が見込める。
  • 分析的モデルは実際の性能を10%未満の平均誤差で正確に予測できており、最適化の指針としての正確性が裏付けられた。
  • 勾配通信の最適化後、特にシングルノード環境において、データI/Oが潜在的なボトルneckとなる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。