[論文レビュー] Dwarfs on Accelerators: Enhancing OpenCL Benchmarking for Heterogeneous Computing Architectures
本稿は、CPU、GPU、MICデバイスを含む異種アーキテクチャにおいて、移植性、再現性、設定可能性を向上させることで、OpenDwarfsのOpenCLベンチマークスイートを拡張する。複数の問題サイズを導入し、欠陥のあるベンチマークを堅牢な代替実装に置き換え、高精度なタイミングとPAPIパフォーマンスカウンターを提供するLibSciBenchを統合し、さまざまなプラットフォームにおけるエネルギーとパフォーマンスの結果を報告することで、HPCワークロードのベンチマーク信頼性と分析能力を顕著に向上させる。
For reasons of both performance and energy efficiency, high-performance computing (HPC) hardware is becoming increasingly heterogeneous. The OpenCL framework supports portable programming across a wide range of computing devices and is gaining influence in programming next-generation accelerators. To characterize the performance of these devices across a range of applications requires a diverse, portable and configurable benchmark suite, and OpenCL is an attractive programming model for this purpose. We present an extended and enhanced version of the OpenDwarfs OpenCL benchmark suite, with a strong focus placed on the robustness of applications, curation of additional benchmarks with an increased emphasis on correctness of results and choice of problem size. Preliminary results and analysis are reported for eight benchmark codes on a diverse set of architectures -- three Intel CPUs, five Nvidia GPUs, six AMD GPUs and a Xeon Phi.
研究の動機と目的
- 異種HPCシステムを評価するための堅牢で、移植性があり、設定可能なベンチマークスイートの不足に対処すること。
- CPU、GPU、Intel Xeon Phiを含む多様なアーキテクチャ間で、OpenCLベンチマークの再現性と正しさを向上させること。
- OpenDwarfsベンチマークスイートに、2次元離散ウェーブレット変換などの新規カーネルを追加し、元のFFTベンチマークのような不十分または誤った実装を置き換えること。
- LibSciBenchとPAPIの統合により、高精度なパフォーマンス測定を可能にし、正確なタイミング、エネルギー、ハードウェアイベント収集を実現すること。
- 現代のアクセラレータプラットフォームにわたる信頼性があり拡張可能なベンチマークフレームワークを提供することで、将来のスケジューリングおよびパフォーマンス移植性研究を支援すること。
提案手法
- Rodiniaスイートからの2次元離散ウェーブレット変換およびBainville(2010)の高性能FFTを含む新規カーネルを追加し、元の欠陥のあるFFT実装を置き換えることで、OpenDwarfsベンチマークスイートを拡張した。
- メモリ階層の特性に基づいて選択された複数の問題サイズを各ベンチマークに導入し、システム固有のパフォーマンス行動を反映させた。
- OSのノイズを低減し、タイミングの再現性を向上させるために、すべてのベンチマークを2秒以上実行するループで実行するように変更した。
- 高分解能タイミング(1マイクロ秒未塔)とカーネル実行、ホスト設定、メモリ転送フェーズのPAPIハードウェアパフォーマンスカウンター収集のため、LibSciBenchを統合した。
- Intel RAPLおよびNVIDIAの電力監視機能をPAPIと併用し、各ベンチマークフェーズごとのエネルギー消費量データを収集した。
- 特に1ジュール未塔の小さな変動を明確に可視化するため、エネルギープロットに対数スケーリングを適用した。
実験結果
リサーチクエスチョン
- RQ1CPU、GPU、MICデバイスを含む多様な異種アーキテクチャにおいて、OpenCLカーネルのパフォーマンスとエネルギー効率はどのように変動するか?
- RQ2既存のベンチマークにおける固定問題サイズとプラットフォーム固有の最適化は、現代のハードウェアにおいてどれほど移植性と正しさを制限するか?
- RQ3LibSciBenchの統合により、OpenCLベンチマーク測定の精度、再現性、解釈可能性は向上するか?
- RQ4異なる問題サイズは、CPUおよびGPUシステムにおけるベンチマークの観測パフォーマンスとエネルギー特性にどのように影響するか?
- RQ5信頼性のあるワークロード特性評価およびスケジューリングを実現するため、ベンチマークの堅牢性と設定可能性にどのような改善が必要か?
主な発見
- OpenDwarfsの元のFFTベンチマークは、特定のプラットフォームや問題サイズで失敗または誤った結果を返していたが、Bainville(2010)のより堅牢で移植性の高い実装に置き換えることで正常に動作するようになった。
- すべてのベンチマークが複数の問題サイズをサポートするようになり、メモリ階層の影響のより良い特定と次世代アクセラレータへの高い移植性が可能になった。
- ほとんどのベンチマークにおいて、CPUのエネルギー消費量がGPUよりも高かったが、crcのような低浮動小数点演算強度のカーネルではCPUが優れていた。
- エネルギーと実行時間のばらつきはCPUで顕著に高く、OSおよびシステムのノイズに敏感であることが確認され、より長く安定した測定ループの必要性が浮き彫りになった。
- LibSciBenchの統合により、1マイクロ秒未塔のタイミング分解能とPAPIパフォーマンスカウンターの信頼性ある収集が可能になり、パフォーマンス分析の正確性と統計的堅牢性が顕著に向上した。
- 強化されたベンチマークスイートは、多様なデバイスで信頼性があり、繰り返し可能で細粒度のパフォーマンス測定を可能としており、将来のスケジューリングおよびパフォーマンス移植性研究の基盤を形成している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。