[論文レビュー] Power Consumption Modeling and Prediction in a Hybrid CPU-GPU-MIC Supercomputer (preliminary version)
本稿では、履歴ジョブトレースとサポートベクターレグレッション(SVR)を用いて、ハイブリッドCPU-GPU-MICスーパーコンピュータ向けのデータ駆動型電力消費モデルフレームワークを提案する。アプリケーション名、リソース使用量、ジョブ期間などのジョブレベル特徴量を活用することで、低レベルのシステム監視やコード解析を必要とせずに、ユーザー固有のジョブ電力消費を80%以上の精度で予測可能となり、リアルタイムの電力意識型スケジューリングおよび請求が可能となる。
Power consumption is a major obstacle for High Performance Computing (HPC) systems in their quest towards the holy grail of ExaFLOP performance. Significant advances in power efficiency have to be made before this goal can be attained and accurate modeling is an essential step towards power efficiency by optimizing system operating parameters to match dynamic energy needs. In this paper we present a study of power consumption by jobs in Eurora, a hybrid CPU-GPU-MIC system installed at the largest Italian data center. Using data from a dedicated monitoring framework, we build a data-driven model of power consumption for each user in the system and use it to predict the power requirements of future jobs. We are able to achieve good prediction results for over 80% of the users in the system. For the remaining users, we identify possible reasons why prediction performance is not as good. Possible applications for our predictive modeling results include scheduling optimization, power-aware billing and system-scale power modeling. All the scripts used for the study have been made available on GitHub.
研究の動機と目的
- エクサフロップスケールのHPCシステムにおけるエネルギー効率の向上という重要な課題に応えるために、正確なジョブ電力予測を可能とすること。
- アプリケーションコードや低レベルのシステム監視を必要としない、ユーザー中心のデータ駆動型電力モデリング手法を開発すること。
- 予測分析を通じて、電力意識型スケジューリング、請求、システムレベルの電力モデリングを支援すること。
- ハイブリッドCPU-GPU-MICアーキテクチャにおける電力消費に影響を与える主要なジョブレベル特徴量を特定・検証すること。
- 適応性を高めるために定期的な再トレーニングを伴うリアルタイムでの電力予測モデルのデプロイを可能とすること。
提案手法
- 本研究では、5秒間隔で収集されたEuroraスーパーコンピュータの履歴ジョブトレースを用い、アプリケーション名、使用したCPU/GPU/MIC数、ジョブ期間などのジョブレベル特徴量を抽出する。
- 電力消費は、サポートベクターレグレッション(SVR)を用いて回帰問題としてモデル化され、各ユーザーごとにその履歴ジョブデータに基づいて個別にモデルをトレーニングする。
- コンponentレベルの電力(CPU、GPU、MIC)は、5分間隔でノードごとの電力使用量を合算して算出し、ジョブ全体の電力はコンponent電力の合計として求める。
- フレームワークはscikit-learnを用いてトレーニングされ、初期のデータ分析にはGoogle BigQueryが使用され、すべてのスクリプトはGitHubでオープンソース化されている。
- 個々のユーザーの使用パターンを捉えるために、ユーザーごとに複数のSVRモデルを用いる。これは、単にコンponent数のみを考慮するベースラインの改善平均モデル(EAM)よりも優れている。
- モデルはオフラインでトレーニングされ、月1回の更新が行われ、ユーザーごとに並列処理が可能であるため、計算オーバーヘッドが低く、リアルタイム予測が可能となる。
実験結果
リサーチクエスチョン
- RQ1ハイブリッドCPU-GPU-MICスーパーコンピュータにおけるジョブ電力消費は、高レベルのジョブ特徴量と履歴データのみを用いて正確に予測可能だろうか?
- RQ2コンponent数を超える特徴量として、非均一なHPCシステムにおける電力消費に最も顕著に影響を与えるジョブレベル特徴量は何か?
- RQ3ユーザー固有のモデリングは、アプリケーションレベルまたは平均ベースのモデリングと比較して、予測精度においてどのように異なるか?
- RQ4データ品質とばらつきが、電力予測モデルの性能にどの程度影響を与えるか?
- RQ5提案されたフレームワークは、リアルタイムでの電力意識型スケジューリングおよびシステムレベルの電力モデリングにデプロイ可能だろうか?
主な発見
- 提案されたSVRベースのユーザー固有モデルは、80%のユーザーに対して20%未満の予測誤差を達成し、改善平均モデル(EAM)を著しく上回る。
- アプリケーション名、ジョブ期間、他のジョブと並列で使用されるリソース量といった特徴量の組み合わせにより、単純なコンponent数モデルを上回る予測精度が実現された。
- 20%のユーザーにおいては、主にデータノイズやジョブ名やリソース使用パターンの不一致が原因でモデル性能が低下した。
- フレームワークは計算的にも効率的であり、全ユーザーのグローバルモデルトレーニングにたった2.92コア時間で、1か月分のデータに対する推論は全ユーザーで6.81分で完了する。
- 本手法はスケーラブルかつ並列処理可能であり、マルチコアクラスタ上で月1回のモデル再トレーニングに約3時間で済み、大規模HPCシステムに適している。
- 本アプローチは、電力意識型スケジューリング、システムレベルの電力モデリング、請求およびリソース計画のためのユーザー側の電力推定といった実用的応用を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。