Skip to main content
QUICK REVIEW

[論文レビュー] Demystifying the MLPerf Benchmark Suite

Snehil Verma, Qinzhe Wu|arXiv (Cornell University)|Aug 24, 2019
Natural Language Processing Techniques参考文献 26被引用数 6
ひとこと要約

本論文は、MLPerfベンチマークスイートの包括的特徴付けを提供し、さまざまなハードウェアプラットフォームにおける多様なワークロードを分析することで、分散ディープラーニング学習におけるシステムのボトル neck を明らかにした。MLPerfベンチマークはスケーリング効率、通信パターン、ハードウェア感受性において顕著に異なることが示され、最適化された相互接続(例:NVLink)、スマートスケジューリング、コンパイラ最適化によってパフォーマンスを最大化する必要があることを示している。

ABSTRACT

MLPerf, an emerging machine learning benchmark suite strives to cover a broad range of applications of machine learning. We present a study on its characteristics and how the MLPerf benchmarks differ from some of the previous deep learning benchmarks like DAWNBench and DeepBench. We find that application benchmarks such as MLPerf (although rich in kernels) exhibit different features compared to kernel benchmarks such as DeepBench. MLPerf benchmark suite contains a diverse set of models which allows unveiling various bottlenecks in the system. Based on our findings, dedicated low latency interconnect between GPUs in multi-GPU systems is required for optimal distributed deep learning training. We also observe variation in scaling efficiency across the MLPerf models. The variation exhibited by the different models highlight the importance of smart scheduling strategies for multi-GPU training. Another observation is that CPU utilization increases with increase in number of GPUs used for training. Corroborating prior work we also observe and quantify improvements possible by compiler optimizations, mixed-precision training and use of Tensor Cores.

研究の動機と目的

  • 異なるハードウェアプラットフォームにおけるMLPerfベンチマークスイートのパフォーマンス特性を分析すること。
  • DAWNBench や DeepBench といった従来のディープラーニングベンチマークと比較して、MLPerfベンチマークがワークロード行動およびシステムボトル neck においてどのように異なるかを理解すること。
  • ハードウェア相互接続(例:PCIe 対 NVLink)、CPU 利用率、システムトポロジーが学習パフォーマンスに与える影響を調査すること。
  • コンパイラ最適化、ミックスド・プレシジョントレーニング、Tensor Core 利用率が MLPerf ワークロードの加速に果たす役割を評価すること。
  • モデル固有のスケーリング特性に基づいた、マルチGPU環境におけるインテリジェントなスケジューリングの機会を同定すること。

提案手法

  • NVLink、PCIeスイッチ、CPUベースのGPU接続を備えた複数のハードウェアプラットフォームで実験を実施し、エンドツーエンドの学習パフォーマンスを評価した。
  • 分散学習(マルチGPU)、複数のハイパーパramーターラン、ミックスドワークロードの3種類のジョブタイプにおけるGPUおよびCPU利用率を測定した。
  • マルチGPU学習における通信オーバーヘッドを評価するため、PCIeおよびNVLinkバス上のデータ転送レートを分析した。
  • XLAコンパイラ最適化とTensor Coreを用いたミックスド・プレシジョントレーニングが収束速度および精度に与える影響を評価した。
  • ルーフラインパフォーマンスモデルにワークロードをマッピングし、MLPerf、DAWNBench、DeepBench 間での演算強度およびメモリ帯域幅要件を比較した。
  • 同じモデル(例:TensorFlow と MXNet におけるResNet-50)を異なるフレームワークで比較することで、実装依存のパフォーマンス差を評価した。

実験結果

リサーチクエスチョン

  • RQ1NVLink と PCIe を備えた異なる相互接続を持つマルチGPUシステムにおいて、MLPerfベンチマークはスケーリング効率および通信パターンでどのように異なるか?
  • RQ2XLA などのコンパイラ最適化とミックスド・プレシジョントレーニングが、MLPerfワークロードのパフォーマンスにどの程度向上効果をもたらすか?
  • RQ3GPU相互接続の選択(PCIe 対 NVLink)が、学習スループットおよびシステム利用率に与える影響は何か?
  • RQ4分散学習におけるモデルアーキテクチャとシステムリソース利用率(CPU/GPU)の関係は何か?
  • RQ5計算強度およびメモリ帯域幅要件の観点から、MLPerfベンチマークは DAWNBench や DeepBench といった従来ベンチマークとどのように異なるか?

主な発見

  • MLPerfベンチマークはスイート内での顕著な非均一性を示しており、スケーリング効率は大きく異なる。例えば、TensorFlow におけるResNet-50 はほぼ完全なスケーリングを示す一方、NCF_Py は低いスケーリング効率を示す。
  • NVLinkを搭載したシステムは、PCIeベースのシステムに比べ最大40%の学習時間短縮を達成し、通信集約型のモデル(例:MLPf_NCF_Py)で最も顕著なパフォーマンス向上が得られた。
  • XLAコンパilationにより、TensorFlowにおけるResNet-50の学習時間が40%短縮されたが、精度に影響を与えることなく、カーネル統合およびコンパイラ最適化の価値を示した。
  • Tensor Coreを用いたミックスド・プレシジョントレーニングは、ResNet-50_TF で3.3倍の高速化を達成したが、MRCNN_Py では1.5倍にとどまり、モデル依存の利得が確認された。
  • GPU数が増えると、特に複数回のランやミックスドランのシナリオで、各GPUのホストプログラムオーバーヘッドによりCPU利用率が顕著に上昇した。
  • 分散学習中のPCIeバス利用率は、MLPf_NCF_Py で最大58.95 GBpsに達し、GPU間直接接続がないPCIe接続システムでは通信がボトル neck となる可能性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。