[論文レビュー] A Simple Model for Portable and Fast Prediction of Execution Time and Power Consumption of GPU Kernels
本論文は、ハードウェアに依存しない特徴量(命令数やカーネル起動設定など)のみを用いて、GPUカーネルの実行時間と消費電力の予測が可能な、ポータブルで高速かつ高精度な機械学習モデルを提案する。主なベンチマークから抽出された189個のカーネルをランダムフォレストで学習させた結果、5種類の異なるGPUアーキテクチャで実行時間の中央値MAPEが8.86–52.0%、消費電力の中央値MAPEが1.84–2.94%に抑えられ、1回の予測遅延は109 ms未満であった。
Characterizing compute kernel execution behavior on GPUs for efficient task scheduling is a non-trivial task. We address this with a simple model enabling portable and fast predictions among different GPUs using only hardware-independent features. This model is built based on random forests using 189 individual compute kernels from benchmarks such as Parboil, Rodinia, Polybench-GPU and SHOC. Evaluation of the model performance using cross-validation yields a median Mean Average Percentage Error (MAPE) of 8.86-52.00% and 1.84-2.94%, for time respectively power prediction across five different GPUs, while latency for a single prediction varies between 15 and 108 milliseconds.
研究の動機と目的
- 異なるGPUアーキテクチャ間で、ハードウェアに依存しないメトリクスに依存せずに、GPUカーネルのパフォーマンスをポータブルかつ高速に予測すること。
- GPGPUワークロード用の汎用的で公開可能なパフォーマンスおよび消費電力モデルの不足に応えること。
- 浮動小数点演算、整数演算、メモリ操作の命令数やスレッド階層、起動設定パラメータなどの静的でハードウェアに依存しない特徴量のみを用いるモデルを開発すること。
- 異種コンピューティング環境における効率的なタスクスケジューリング、システムプロビジョニング、エネルギー効率の最適化されたワークロード配置を支援すること。
- 特にコンsumer向けおよびエントレープライズ向けデバイスを対象に、GPU間で再利用可能なパフォーマンスモデルのポータビリティと再利用性を向上させること。
提案手法
- モデルは、ハードウェアに依存しない特徴量と実行時間/消費電力の間のマッピングをランダムフォレストを用いて学習する。
- 特徴量には、異なるアドレス空間における浮動小数点演算、整数演算、メモリ操作の命令数に加え、スレッド階層と起動設定パラメータが含まれる。
- 学習データは、Parboil、Rodinia、Polybench-GPU、SHOCを含むベンチマークから得られた189個のユニークなGPUカーネルから抽出された。
- クロスバリデーションを用いて、K20、Titan Xp、P100、V100、GTX1650の5種類の異なるGPUアーキテクチャにおけるモデルの一般化性能を評価した。
- キャッシュヒット率などのハードウェア依存特徴量を除外することで、GPU世代間でのポータビリティを確保した。
- 予測遅延は1カーネルあたり15–108 msで測定され、スケジューリングシステムにおけるリアルタイムまたはニアリアルタイム利用が可能である。
実験結果
リサーチクエスチョン
- RQ1GPUカーネルの実行時間と消費電力は、ハードウェアに依存しない特徴量のみを用いて正確に予測可能か?
- RQ2再トレーニングを行わずに、1つのモデルが多様なGPUアーキテクチャにどれほど一般化できるか?
- RQ3カーネル実行時間の長さや起動設定が予測精度に与える影響は何か?
- RQ4動的周波数スケーリングを備えたコンsumer向けGPUと比較して、モデルの性能はどのように異なるか?
- RQ5異種コンピューティング環境におけるタスクスケジューリングやシステムプロビジョニングといった実用的応用に、モデルは対応可能か?
主な発見
- P100 GPUでは実行時間予測の中央値MAPEが8.86%に抑えられ、V100では10.89%、GTX1650では52.0%に達する。
- すべての5種類のGPUで消費電力の中央値MAPEが1.84–2.94%に抑えられ、高い精度と頑健性を示した。
- 動的周波数スケーリングを備えたコンsumer向けGPUであるGTX1650では、実行時間予測誤差が最大(中央値MAPE 52.0%)を示し、学習データに長時間実行されるカーネルが十分に含まれていないことが要因とされる。
- すべてのGPUで低コストの消費電力予測誤差(MAPE 1.84–2.94%)を維持しており、消費電力メトリクスにおける強力な一般化性能を示している。
- 1回の予測は15–108 msで生成され、ランタイムスケジューリングシステムへの実用的導入が可能である。
- モデルは公開されており、新しいGPUアーキテクチャ向けに再トレーニング可能であり、CUDAベースのデバイス間でのポータビリティをサポートする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。