Skip to main content
QUICK REVIEW

[論文レビュー] HPC AI500: Representative, Repeatable and Simple HPC AI Benchmarking

Zihan Jiang, Wanling Gao|arXiv (Cornell University)|Feb 25, 2021
Advanced Data Storage Technologies参考文献 31被引用数 4
ひとこと要約

本論文は、ハイパフォーマンスコンピューティング(HPC)AIシステム向けの代表的で再現可能かつシンプルなベンチマーキング手法、HPC AI500を紹介する。2つのワークロード—画像分類(ビジネス分野)と極端な気象解析(科学的分野)—を採用し、スループットとターゲット精度を組み合わせた指標であるValid FLOPSを提案してシステムをランク付けする。64 GPUで混合精度学習と通信圧縮を適用した場合、ベンチマークは939 TFLOPSを達成した。

ABSTRACT

Recent years witness a trend of applying large-scale distributed deep learning algorithms (HPC AI) in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. This paper presents a representative, repeatable and simple HPC AI benchmarking methodology. Among the seventeen AI workloads of AIBench Training -- by far the most comprehensive AI Training benchmarks suite -- we choose two representative and repeatable AI workloads. The selected HPC AI benchmarks include both business and scientific computing: Image Classification and Extreme Weather Analytics. To rank HPC AI systems, we present a new metric named Valid FLOPS, emphasizing both throughput performance and a target quality. The specification, source code, datasets, and HPC AI500 ranking numbers are publicly available from \url{https://www.benchcouncil.org/HPCAI500/}.

研究の動機と目的

  • HPC AIワークロード向けに代表的で再現可能かつシンプルなベンチマークが不足している問題に対処すること。
  • ビジネスおよび科学的計算分野を反映する2つのAIワークロードを特定・選定すること。
  • スループットとターゲットモデル品質(正確性)の両方を考慮する新しいパフォーマンス指標、Valid FLOPSの開発。
  • 標準化されたソースコード、データセット、設定を用いてベンチマークの再現性を確保すること。
  • HPC AI500ベンチマークに基づき、HPC AIシステムの公開ランク付けを実施すること。

提案手法

  • AIBench Trainingに含まれる17のワークロードから、代表的なAIワークロードとして画像分類と極端な気象解析を選定する。
  • 大規模なGPUシステムでのパフォーマンス最適化のため、混合精度学習と通信圧縮を採用する。
  • FLOPSとモデル正確性を組み合わせた指標であるValid FLOPSを導入し、品質到達までの時間を反映する。
  • 公開されたソースコード、データセット、システム設定を通じて、ベンチマークの標準化を実施する。
  • 再現性を確保するため、モデル特性、マイクロアーキテクチャ、ランダムネスの体系的分析を実施する。
  • 1〜64 GPUにおけるスケーラビリティを検証し、並列効率と通信オーバーヘッドを測定する。

実験結果

リサーチクエスチョン

  • RQ1どのHPC AIワークロードが、再現可能性とシンプルさを確保しつつ、ビジネスおよび科学的計算分野を最も適切に代表するか?
  • RQ2分散ディープラーニングにおいて、計算スループットとモデル品質(正確性)の両方を反映するベンチマーク指標は、どのように設計できるか?
  • RQ3大規模HPC AI学習における主なパフォーマンスボトルネック(計算 vs. 通信)は何か、またワークロードごとにどのように変化するか?
  • RQ4混合精度学習と通信圧縮は、大規模GPUクラスタにおいて、どの程度パフォーマンスとスケーラビリティを向上させるか?
  • RQ5システムスケールが、分散HPC AIワークロードにおけるモデル正確性と学習効率に、どの程度影響を与えるか?

主な発見

  • 画像分類ベンチマークは、64 GPUで混合精度最適化と通信圧縮を適用した結果、939 TFLOPSを達成した。
  • 極端な気象解析(EWA)ワークロードは通信圧縮を適用した場合、109 TFLOPSを達成し、スケールアップに伴い顕著な高速化を示した。
  • EWAでは画像分類に比べて通信帯域幅の消費が顕著に高く、EWAが通信集約的であるのに対し、画像分類は計算集約的であることが確認された。
  • 64 GPUで並列効率はEWAで0.36、画像分類で0.37に低下したが、これは低速なイーサーネットを介した通信ボトルネックによるものであった。
  • 画像分類のFP32バージョンでは、64 GPUでパフォーマンスが345から414 TFLOPSに向上したのに対し、混合精度バージョンでは718から939 TFLOPSに向上した。
  • 富士通はHPC AI500ランクで31.41 VPFLOPSを達成し、最高のValid FLOPS性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。