[論文レビュー] HPC AI500: The Methodology, Tools, Roofline Performance Models, and Metrics for Benchmarking HPC AI Systems
本論文は、同等性、代表性、費用対効果、再現可能性を保証する高性能コンピューティング(HPC)AIシステム向けの包括的ベンチマーク手法HPC AI500 V2を紹介する。AIBenchに基づく2つの実世界ベンチマーク(画像分類および極端な気象解析)に加え、ルーフライン性能モデルと、有効FLOPSおよび有効FLOPS/ワットといった新規指標を提案し、システムの性能とエネルギー効率を客観的に評価する。
The recent years witness a trend of applying large-scale distributed deep learning in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC community feels a great interest in building the HPC AI systems that are dedicated to running those workloads. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. None of previous HPC AI benchmarks achieve the goal of being equivalent, relevant, representative, affordable, and repeatable. This paper presents a comprehensive methodology, tools, Roofline performance models, and innovative metrics for benchmarking, optimizing, and ranking HPC AI systems, which we call HPC AI500 V2.0. We abstract the HPC AI system into nine independent layers, and present explicit benchmarking rules and procedures to assure equivalence of each layer, repeatability, and replicability. On the basis of AIBench -- by far the most comprehensive AI benchmarks suite, we present and build two HPC AI benchmarks from both business and scientific computing: Image Classification, and Extreme Weather Analytics, achieving both representativeness and affordability. To rank the performance and energy-efficiency of HPC AI systems, we propose Valid FLOPS, and Valid FLOPS per watt, which impose a penalty on failing to achieve the target quality. We propose using convolution and GEMM -- the two most intensively-used kernel functions to measure the upper bound performance of the HPC AI systems, and present HPC AI roofline models for guiding performance optimizations. The evaluations show our methodology, benchmarks, performance models, and metrics can measure, optimize, and rank the HPC AI systems in a scalable, simple, and affordable way. HPC AI500 V2.0 are publicly available from http://www.benchcouncil.org/benchhub/hpc-ai500-benchmark.
研究の動機と目的
- 異なるハードウェアおよびソフトウェアスタック間で公平に性能を比較できる、同等性、再現可能性、代表性を確保するベンチマークの不足を解消すること。
- MLPerf、HPL-AI、Deep500、AAHといった既存ベンチマークの限界を克服し、同等性、再現可能性、実世界ワークロードの代表性を確保できない点を是正すること。
- HPC AIシステムを9つの独立したレイヤーに抽象化する手法を構築し、厳密な同等性と再現可能性を保証する、制御されたレイヤーワイズのベンチマーク手法を提供すること。
- 実世界のビジネスおよび科学的AIワークロードから派生した、費用対効果が高く、代表性があり、スケーラブルなベンチマークを構築すること。具体的には、ImageNet/ResNet-50および極端な気象解析を対象とする。
- 性能を公平にランク付けするための新規指標として、有効FLOPSおよび有効FLOPS/ワットを導入し、目標とするモデル品質に到達できないシステムに対してペナルティを科すことで、性能とエネルギー効率の両方のランク付けを公正に保証すること。
提案手法
- HPC AIシステムをハードウェア、ソフトウェアスタック、通信など9つの独立したレイヤーに抽象化し、他のレイヤーを固定した状態で各レイヤーを分離してテストすることで、同等性と再現可能性を確保する。
- 各レイヤーに対して厳密なベンチマークルールと手順(並列処理、通信、精度設定など)を定義し、異なるシステム間での一貫性ある実装を保証する。
- AIBenchスイートから派生した完全なスタックベンチマーク2つを構築:画像分類(ImageNet/ResNet-50に基づく)および極端な気象解析(実際の科学的データセットを用いる)。
- 畳み込み演算およびGEMMカーネルを用いたHPC AIルーフラインモデルを構築し、性能の上限を定義することで、体系的な性能分析と最適化のガイダンスを可能にする。
- 目標とするモデル精度に到達できないシステムに対してペナルティを科す有効FLOPSおよび有効FLOPS/ワットという新規指標を導入し、性能ランク付けが速度と品質適合性の両方を反映するようにする。
- BenchCouncilの公開リポジトリを通じて、仕様書、ソースコード、データセット、ベンチマークデータをすべてオープンソースで公開し、透明性、再現可能性、コミュニティによる採用を促進する。
実験結果
リサーチクエスチョン
- RQ1異なるハードウェアおよびソフトウェア構成において、同等性、再現可能性、再現性を保証するHPC AIシステムのベンチマーク手法はどのように構築できるか?
- RQ2ビジネスおよび科学的コンピューティング分野におけるHPC AIシステムの性能特性を最もよく反映する実世界のAIワークロードは何か?
- RQ3システムが目標とするモデル品質を達成できる能力に差がある場合、性能とエネルギー効率をどのように公平にランク付けできるか?
- RQ4基本的なカーネル(畳み込みおよびGEMM)に基づくルーフラインモデルは、HPC AIワークロードのシステムレベル最適化をどのように支援するか?
- RQ5スケーラブルでありながらも、高い代表性と技術的厳密性を維持しつつ、費用対効果の高いベンチマーク手法を構築することは可能か?
主な発見
- HPC AI500 V2の手法は、9つの独立したレイヤーに抽象化し、標準化されたテストルールを適用することで、同等性、再現性、再現可能性を成功裏に達成した。
- 画像分類および極端な気象解析の2つのベンチマークは、実世界のデータセットとプロダクショングレードのモデルを用いることで、高い代表性と費用対効果を示した。
- 有効FLOPSおよび有効FLOPS/ワットという新規指標の導入により、目標精度に到達できないシステムに対してペナルティが科されることで、性能およびエネルギー効率の公平なランク付けが可能になった。
- 畳み込みおよびGEMMカーネルに基づくHPC AIルーフラインモデルは、性能ボトルネックの特定とHPC AIシステムの最適化戦略のガイダンスに効果的に機能した。
- 評価結果から、この手法、ベンチマーク、モデル、指標はスケーラブルで、シンプルかつ費用対効果が高く、多様なHPC AIプラットフォーム間で一貫したシステム評価を可能にすることが確認された。
- すべての仕様書、ソースコード、データセット、ベンチマークデータは、http://www.benchcouncil.org/benchhub/hpc-ai500-benchmark で公開されており、透明性とコミュニティ全体での採用を支援している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。