Skip to main content
QUICK REVIEW

[論文レビュー] Predicting batch queue job wait times for informed scheduling of urgent HPC workloads

Nick Brown, Gordon S. Gibb|arXiv (Cornell University)|Apr 28, 2022
Cloud Computing and Resource Management被引用数 9
ひとこと要約

本論文では、ブーストドツリーと確率的キュー状態モデルを用いた機械学習的手法を提案し、HPCジョブの開始時刻を高い精度で予測する。ARCHER2およびCirrusにおいて、実際の開始時刻から1分以内の予測を65–76%達成し、Slurmの推定器を最大18倍高い精度で上回った。動的キュー状態の組み込みと、段階的な分類・回帰パイプラインにより、予測精度が向上した。

ABSTRACT

There is increasing interest in the use of HPC machines for urgent workloads to help tackle disasters as they unfold. Whilst batch queue systems are not ideal in supporting such workloads, many disadvantages can be worked around by accurately predicting when a waiting job will start to run. However there are numerous challenges in achieving such a prediction with high accuracy, not least because the queue's state can change rapidly and depend upon many factors. In this work we explore a novel machine learning approach for predicting queue wait times, hypothesising that such a model can capture the complex behaviour resulting from the queue policy and other interactions to generate accurate job start times. For ARCHER2 (HPE Cray EX), Cirrus (HPE 8600) and 4-cabinet (HPE Cray EX) we explore how different machine learning approaches and techniques improve the accuracy of our predictions, comparing against the estimation generated by Slurm. We demonstrate that our techniques deliver the most accurate predictions across our machines of interest, with the result of this work being the ability to predict job start times within one minute of the actual start time for around 65\% of jobs on ARCHER2 and 4-cabinet, and 76\% of jobs on Cirrus. When compared against what Slurm can deliver, this represents around 3.8 times better accuracy on ARCHER2 and 18 times better for Cirrus. Furthermore our approach can accurately predicting the start time for three quarters of all job within ten minutes of the actual start time on ARCHER2 and 4-cabinet, and for 90\% of jobs on Cirrus. Whilst the driver of this work has been to better facilitate placement of urgent workloads across HPC machines, the insights gained can be used to provide wider benefits to users and also enrich existing batch queue systems and inform policy too.

研究の動機と目的

  • 緊急の災害対応シミュレーションに特に重要な、HPCバッチキューにおける予測不可能なジョブ待機時間の課題を解決すること。
  • Slurmの組み込みキュー待機時間推定がしばしば不正確で、システム間で一貫性に欠けることへの改善を図ること。
  • 変動するワークロードやスケジューリングポリシーを含む、複雑なキューのダイナミクスを捉える機械学習モデルの開発。
  • 信頼性の高い開始時刻予測に基づき、ユーザーおよびHPCセンターがジョブ設定やリソース割り当てについて意思決定を下せるようにすること。
  • 多様なワークロードやポリシーを持つさまざまなHPCシステムに適用可能なスケーラブルでデータ駆動型のソリューションを提供すること。

提案手法

  • 本手法は、3つの本番HPCシステム(ARCHER2、Cirrus、4ラックのHPE Cray EX)の履歴ジョブデータを用いて、機械学習モデルを学習する。
  • 実際の実行時間と要求されたウォールタイムの分布に基づき、1ジョブあたり100の代表的キューワークロード状態を確率的サンプリングで生成し、提出時におけるキュー負荷の不確実性をモデル化する。
  • 分類(ターゲットウィンドウ内にジョブが開始するかを予測)と回帰(正確な開始時刻を予測)の2段階パイプラインを組み合わせることで、精度を向上させる。
  • ジョブパラメータとキュー行動との非線形関係を扱えるように、勾配ブースティングツリー(例:XGBoost)を採用する。
  • キュー状態特徴量には、現在実行中のジョブ、キューイング中のジョブ、およびそれらの要求されたウォールタイムが含まれ、リアルタイムの不確実性を反映するための動的サンプリングが行われる。
  • Slurmのバックフィルプラグイン推定器と比較し、平均絶対誤差や予測ウィンドウ精度などの指標を用いて検証された。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、Slurmの組み込み推定器と比較して、HPCジョブの待機時間予測の精度を顕著に向上させることができるか?
  • RQ2動的かつ確率的なキュー状態表現を組み込むことで、変動が激しいHPCワークロードにおいて予測精度がどのように向上するか?
  • RQ3段階的な分類・回帰モデルは、正確なジョブ開始時刻を予測する際、単一モデルアプローチをどれほど上回るか?
  • RQ4異なるワークロードとスケジューリングポリシーを持つさまざまなHPCシステムにおいて、予測精度はどのように変動するか?
  • RQ5ユーザーがジョブ設定(例:ノード数、ウォールタイム)を最適化して待機時間を短縮するための実用的インサイトをモデルが提供できるか?

主な発見

  • 提案モデルは、ARCHER2および4ラックシステムにおいて、実際のジョブ開始時刻から1分以内の予測を65%達成し、Cirrusでは76%に達した。これはSlurmを著しく上回った。
  • 10分以内の精度ウィンドウでは、ARCHER2および4ラックシステムで75%のジョブが正しく予測され、Cirrusでは90%に達した。Slurmの性能と比較して顕著に優れた結果であった。
  • 1分以内の誤差を測定した場合、ARCHER2では3.8倍、Cirrusでは18倍の精度向上を達成した。
  • 段階的な分類・回帰アプローチにより、ジョブ固有のパターンとキュー状態ダイナミクスをより効果的に活用することで、誤差が低減された。
  • 確率的キュー状態サンプリング手法は、現実の不確実性を効果的にモデル化し、多様なワークロードにわたるモデルのロバストネスを向上させた。
  • 本モデルは、緊急計算システムVESTECに統合され、動的で時間的に敏感なHPCワークロードにおける実用的価値を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。