[論文レビュー] HPC AI500: Representative, Repeatable and Simple HPC AI Benchmarking
本論文は、ハイパフォーマンスコンピューティング(HPC)AIシステム向けの代表的で再現可能かつシンプルなベンチマーキング手法、HPC AI500を紹介する。2つのワークロード—画像分類(ビジネス分野)と極端な気象解析(科学的分野)—を採用し、スループットとターゲット精度を組み合わせた指標であるValid FLOPSを提案してシステムをランク付けする。64 GPUで混合精度学習と通信圧縮を適用した場合、ベンチマークは939 TFLOPSを達成した。
Recent years witness a trend of applying large-scale distributed deep learning algorithms (HPC AI) in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. This paper presents a representative, repeatable and simple HPC AI benchmarking methodology. Among the seventeen AI workloads of AIBench Training -- by far the most comprehensive AI Training benchmarks suite -- we choose two representative and repeatable AI workloads. The selected HPC AI benchmarks include both business and scientific computing: Image Classification and Extreme Weather Analytics. To rank HPC AI systems, we present a new metric named Valid FLOPS, emphasizing both throughput performance and a target quality. The specification, source code, datasets, and HPC AI500 ranking numbers are publicly available from \url{https://www.benchcouncil.org/HPCAI500/}.
研究の動機と目的
- HPC AIワークロード向けに代表的で再現可能かつシンプルなベンチマークが不足している問題に対処すること。
- ビジネスおよび科学的計算分野を反映する2つのAIワークロードを特定・選定すること。
- スループットとターゲットモデル品質(正確性)の両方を考慮する新しいパフォーマンス指標、Valid FLOPSの開発。
- 標準化されたソースコード、データセット、設定を用いてベンチマークの再現性を確保すること。
- HPC AI500ベンチマークに基づき、HPC AIシステムの公開ランク付けを実施すること。
提案手法
- AIBench Trainingに含まれる17のワークロードから、代表的なAIワークロードとして画像分類と極端な気象解析を選定する。
- 大規模なGPUシステムでのパフォーマンス最適化のため、混合精度学習と通信圧縮を採用する。
- FLOPSとモデル正確性を組み合わせた指標であるValid FLOPSを導入し、品質到達までの時間を反映する。
- 公開されたソースコード、データセット、システム設定を通じて、ベンチマークの標準化を実施する。
- 再現性を確保するため、モデル特性、マイクロアーキテクチャ、ランダムネスの体系的分析を実施する。
- 1〜64 GPUにおけるスケーラビリティを検証し、並列効率と通信オーバーヘッドを測定する。
実験結果
リサーチクエスチョン
- RQ1どのHPC AIワークロードが、再現可能性とシンプルさを確保しつつ、ビジネスおよび科学的計算分野を最も適切に代表するか?
- RQ2分散ディープラーニングにおいて、計算スループットとモデル品質(正確性)の両方を反映するベンチマーク指標は、どのように設計できるか?
- RQ3大規模HPC AI学習における主なパフォーマンスボトルネック(計算 vs. 通信)は何か、またワークロードごとにどのように変化するか?
- RQ4混合精度学習と通信圧縮は、大規模GPUクラスタにおいて、どの程度パフォーマンスとスケーラビリティを向上させるか?
- RQ5システムスケールが、分散HPC AIワークロードにおけるモデル正確性と学習効率に、どの程度影響を与えるか?
主な発見
- 画像分類ベンチマークは、64 GPUで混合精度最適化と通信圧縮を適用した結果、939 TFLOPSを達成した。
- 極端な気象解析(EWA)ワークロードは通信圧縮を適用した場合、109 TFLOPSを達成し、スケールアップに伴い顕著な高速化を示した。
- EWAでは画像分類に比べて通信帯域幅の消費が顕著に高く、EWAが通信集約的であるのに対し、画像分類は計算集約的であることが確認された。
- 64 GPUで並列効率はEWAで0.36、画像分類で0.37に低下したが、これは低速なイーサーネットを介した通信ボトルネックによるものであった。
- 画像分類のFP32バージョンでは、64 GPUでパフォーマンスが345から414 TFLOPSに向上したのに対し、混合精度バージョンでは718から939 TFLOPSに向上した。
- 富士通はHPC AI500ランクで31.41 VPFLOPSを達成し、最高のValid FLOPS性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。