[論文レビュー] RLScheduler: An Automated HPC Batch Job Scheduler Using Reinforcement Learning
RLScheduler は強化学習に基づく HPC バッチジョブスケジューラーであり、試行錯誤を通じて最小限の専門的介入で高品質なスケジューリングポリシーを自動で学習する。さまざまなワークロードおよび最適化目標において従来のスケジューラーを上回り、カーネルベースのニューラルネットワークとトラジェクトリーフィルタリングを用いることで、効率的で頑健な学習が可能になり、未学習のワークロードに対しても安定した性能を示す。
Today high-performance computing (HPC) platforms are still dominated by batch jobs. Accordingly, effective batch job scheduling is crucial to obtain high system efficiency. Existing HPC batch job schedulers typically leverage heuristic priority functions to prioritize and schedule jobs. But, once configured and deployed by the experts, such priority functions can hardly adapt to the changes of job loads, optimization goals, or system settings, potentially leading to degraded system efficiency when changes occur. To address this fundamental issue, we present RLScheduler, an automated HPC batch job scheduler built on reinforcement learning. RLScheduler relies on minimal manual interventions or expert knowledge, but can learn high-quality scheduling policies via its own continuous 'trial and error'. We introduce a new kernel-based neural network structure and trajectory filtering mechanism in RLScheduler to improve and stabilize the learning process. Through extensive evaluations, we confirm that RLScheduler can learn high-quality scheduling policies towards various workloads and various optimization goals with relatively low computation cost. Moreover, we show that the learned models perform stably even when applied to unseen workloads, making them practical for production use.
研究の動機と目的
- 固定された手動チューニングされた優先度関数に依存する従来の HPC スケジューラーの不柔軟性に対処すること。
- 変化するワークロードと最適化目標に動的に対応できる自動的で適応的なジョブスケジューリングを実現すること。
- 強化学習が専門的介入なしに安定的で高性能なスケジューリングポリシーを学習できるかどうかを評価すること。
- RLベースのスケジューラーの性能に影響を与える要因を特定し、学習効率と頑健性の向上のための解決策を提案すること。
提案手法
- RLScheduler は、提出時刻、要求プロセッサ数、実行時間などのジョブ属性に基づいてジョブ優先度を割り当てるための強化学習で訓練されたディープ Q ネットワーク(DQN)エージェントを採用する。
- 多様なジョブワークロードにわたるポリシー表現と汎化性能の向上を図るため、カーネルベースのディープニューラルネットワークを導入する。
- 学習データのノイズと分散を低減し、学習プロセスの安定化を図るために、トラジェクトリーフィルタリング機構を用いる。
- ジョブスループット、待機時間、リソース利用率といったシステムレベルの指標に基づくスパarsな報酬に基づいて訓練を行う。
- 合成および実世界のジョブトレースを用いて訓練を行い、未学習のワークロードでの評価を通じて汎化性能をテストする。
- バックフィリングありおよびなしの両条件でシステムを評価し、展開シナリオにわたる頑健性を評価する。
実験結果
リサーチクエスチョン
- RQ1強化学習は、さまざまなワークロードおよび最適化目標において、最先端のヒューリスティックスケジューラーと同等またはそれを上回る高品質なスケジューリングポリシーを学習できるか?
- RQ2学習中に見なかった未確認のジョブワークロードに対しても、学習済みの RL ポリシーは効果的に汎化できるか?
- RQ3RLベースの HPC スケジューラーの学習効率と性能安定性に影響を与える主な要因は何か?
- RQ4ニューラルネットワークアーキテクチャとトレーニングデータの分散は、学習済みスケジューリングポリシーのスケーラビリティと頑健性にどのように影響するか?
主な発見
- RLScheduler は、FCFS、SJF、WFP3、UNICEP といった最先端のスケジューラーと同等またはそれ以上のスケジューリング性能を、多数の実際および合成ワークロードで達成した。
- バックフィリングありの Lublin-1 トレースにおいて、RLScheduler は平均ジョブ待機時間を 12,460 秒にまで短縮し、FCFS(24,887 秒)や他のスケジューラーを上回った。
- バックフィリングなしの HPC2N において、ジョブスローダウンは RLScheduler で 270.7 にまで低下し、FCFS(13,938)や UNICEP(29,633)を著しく上回った。
- モデルは未学習のワークロードに対しても良好に汎化し、1つのトレースで学習した後でも別のトレースでテストした際にも安定した性能を維持した。これにより、強力な汎化能力が示された。
- カーネルベースのニューラルネットワークとトラジェクトリーフィルタリング機構は、学習の安定性と収束速度を顕著に向上させ、ポリシー学習における分散を低減した。
- トレーニング中の計算コストは低く抑えられ、スループット、待機時間、スローダウンといった多様な指標において高い性能を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。