[論文レビュー] Benchmarking the Performance and Energy Efficiency of AI Accelerators for AI Training
この論文は、CNN、RNN、Transformers、Deep Speech 2を含む多様なワークロードにおけるディープラーニング学習のパフォーマンスとエネルギー効率を、Intel CPU、NVIDIAおよびAMD GPU、Google TPUでベンチマークしている。包括的な評価フレームワークを用いることで、ハードウェアおよびソフトウェアスタック全体におけるパフォーマンスと消費エネルギーの顕著な差異が明らかになり、AIアクセラレータの選定や最適化のための実用的知見が得られた。
Deep learning has become widely used in complex AI applications. Yet, training a deep neural network (DNNs) model requires a considerable amount of calculations, long running time, and much energy. Nowadays, many-core AI accelerators (e.g., GPUs and TPUs) are designed to improve the performance of AI training. However, processors from different vendors perform dissimilarly in terms of performance and energy consumption. To investigate the differences among several popular off-the-shelf processors (i.e., Intel CPU, NVIDIA GPU, AMD GPU, and Google TPU) in training DNNs, we carry out a comprehensive empirical study on the performance and energy efficiency of these processors by benchmarking a representative set of deep learning workloads, including computation-intensive operations, classical convolutional neural networks (CNNs), recurrent neural networks (LSTM), Deep Speech 2, and Transformer. Different from the existing end-to-end benchmarks which only present the training time, We try to investigate the impact of hardware, vendor's software library, and deep learning framework on the performance and energy consumption of AI training. Our evaluation methods and results not only provide an informative guide for end-users to select proper AI accelerators, but also expose some opportunities for the hardware vendors to improve their software library.
研究の動機と目的
- 実世界のディープラーニングワークロードにおける、先端的なAIアクセラレータ(Intel CPU、NVIDIAおよびAMD GPU、Google TPU)のパフォーマンスとエネルギー効率を評価・比較すること。
- ハードウェアアーキテクチャ、ベンダー最適化ソフトウェアライブラリ(例:cuDNN、ROCm、TensorFlow)およびディープラーニングフレームワークが、学習パフォーマンスとエネルギー消費に与える影響を分析すること。
- 予算およびパフォーマンス制約下で、コスト効率よく効率的なAIアクセラレータを選定するための実証的ガイダンスをエンドユーザーに提供すること。
- 特にカーネルレベルの利用状況とエネルギー効率に焦点を当て、ハードウェアおよびソフトウェアベンダーむけい性能ボトルネックと最適化の機会を明らかにすること。
提案手法
- 計算集約的演算、CNN、LSTM、Deep Speech 2、Transformersを含む代表的なディープラーニングワークロードをベンチマークした。
- 同一設定下で、複数のハードウェアプラットフォームにおけるエンドツーエンドの学習パフォーマンス(サンプル/秒)およびエネルギー消費(J/サンプル)を測定した。
- ハードウェアおよびソフトウェアスタックの各要素に与える影響を分離するために、低レベル演算およびフルモデル学習の両方を評価した。
- 標準化されたフレームワーク(例:TensorFlow)およびベンダー最適化ライブラリ(cuDNN、ROCm、MKLDNN)を用いて、現実的なパフォーマンス評価を保証した。
- ルーフラインモデルを適用し、パフォーマンスの上限を分析し、GPUの利用状況におけるソフトウェア非効率性を同定した。
- 複数世代のGPU(P100、V100、Titan X)およびTPU(Cloud TPU v2/v3)の結果を収集し、電力およびエネルギーメトリクスを含めた。
実験結果
リサーチクエスチョン
- RQ1異なるAIアクセラレータ(CPU、GPU、TPU)は、多様なディープラーニングワークロードにおいて、パフォーマンスとエネルギー効率でどのように比較されるか?
- RQ2ソフトウェアライブラリ(例:cuDNN、ROCm)およびフレームワークの選択が、AI学習のパフォーマンスとエネルギー消費に及ぼす影響はどの程度か?
- RQ3高機能GPU(NVIDIA)と新興代替品(AMD Radeon VII)の間で、DNN学習におけるパフォーマンスとエネルギーのトレードオフはどのようなものか?
- RQ4TPUにおけるハードウェア固有の最適化は、GPUベースのアクセラレータと比較して、スループットおよびエネルギー効率の面でどの程度優れているか?
- RQ5現在のAIアクセラレータスタックにおける、パフォーマンスおよびエネルギー効率を制限する主なボトルネックは何か?
主な発見
- Google TPU v3は、Transformersモデルにおいて最高のスループット(最大35,772.93 サンプル/秒)を達成し、GPUおよびCPUを大きく上回った。
- AMD Radeon VIIは、ResNet-50の学習で275.50 サンプル/秒を達成し、NVIDIA Titan X(260.15 サンプル/秒)を上回り、V100性能に近づいた。
- エネルギー効率は顕著に異なる:V100(MP)はResNet-50で最小のエネルギー消費(0.0066 J/サンプル)を記録したのに対し、CPUは300.12 J/サンプルを消費し、一般用途プロセッサの高エネルギー非効率性が明らかになった。
- NVIDIA V100 GPUは、ResNet-50で0.0088 J/サンプルの優れたパフォーマンス-エネルギー比を示した。P100(0.0123 J/サンプル)およびRadeon VII(0.0198 J/サンプル)と比較して顕著に優れていた。
- Titan X(Pascal)は、より大きなモデルでは一貫性のないパフォーマンスを示し、一部のワークロードでOOM(メモリ不足)エラーを発生させ、メモリ制限の問題を浮き彫りにした。
- 同程度の計算能力を持つGPU間でもパフォーマンスの差が見られたことから、ソフトウェアスタックおよびカーネル最適化が実世界の効率性に重要な役割を果たしていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。