Skip to main content
QUICK REVIEW

[論文レビュー] Aryl: An Elastic Cluster Scheduler for Deep Learning

Jiamin Li, Hong Xu|arXiv (Cornell University)|Feb 16, 2022
Cloud Computing and Resource Management被引用数 5
ひとこと要約

Arylは、動的スケーリングと知的なプリエンプションヒューリスティクスを用いて、アイドル状態の推論GPUクラスタからトレーニングジョブへ容量を一時的に貸し出し、キューイング時間を短縮し、利用率を向上させる、新しいクラスタースケジューラーである。ベースラインスケジューラーと比較して、平均キューイング時間を1.53倍短縮し、ジョブ完了時間を1.50倍短縮する。大規模シミュレーションでは、クラスタ利用率が最大26.9%向上する。

ABSTRACT

Companies build separate training and inference GPU clusters for deep learning, and use separate schedulers to manage them. This leads to problems for both training and inference: inference clusters have low GPU utilization when the traffic load is low; training jobs often experience long queueing time due to lack of resources. We introduce Aryl, a new cluster scheduler to address these problems. Aryl introduces capacity loaning to loan idle inference GPU servers for training jobs. It further exploits elastic scaling that scales a training job's GPU allocation to better utilize loaned resources. Capacity loaning and elastic scaling create new challenges to cluster management. When the loaned servers need to be returned, we need to minimize the number of job preemptions; when more GPUs become available, we need to allocate them to elastic jobs and minimize the job completion time (JCT). Aryl addresses these combinatorial problems using principled heuristics. It introduces the notion of server preemption cost which it greedily reduces during server reclaiming. It further relies on the JCT reduction value defined for each additional worker for an elastic job to solve the scheduling problem as a multiple-choice knapsack problem. Prototype implementation on a 64-GPU testbed and large-scale simulation with 15-day traces of over 50,000 production jobs show that Aryl brings 1.53x and 1.50x reductions in average queuing time and JCT, and improves cluster usage by up to 26.9% over the cluster scheduler without capacity loaning or elastic scaling.

研究の動機と目的

  • ピーク時以外の推論クラスタにおけるGPU利用率の低さと、リソース不足に起因する長時間のトレーニングジョブキューイング時間を解消すること。
  • 低交通量時におけるアイドル状態の推論GPUサーバーを、トレーニングワークロードと動的に共有可能にするための容量貸し出しを実現すること。
  • スケーリングに伴う弾力的トレーニングジョブのリソース増減に伴い、サーバー回収時のプリエンプションコストを最小限に抑え、ジョブ完了時間(JCT)を短縮すること。
  • 異種のGPU利用可能性と変動するジョブリソース要件を効率的に処理できるスケジューリングシステムを設計すること。
  • トレーニングジョブのキューイング遅延を低く保ちながら、全体のクラスタ利用率を向上させること。

提案手法

  • アイドル状態の推論GPUサーバーを、交通量が少ない時期に一時的にトレーニングジョブに割り当てる「容量貸し出し」を導入する。
  • 弾力的スケーリングを採用し、利用可能なリソースに応じてトレーニングジョブのGPUワーカー数を動的に増減可能にする。
  • 2段階スケジューリングアプローチを採用:まず不変(非弾力的)リソース要件を割り当て、次に複数選択型ナップサック定式化を用いてJCTを最小化するように弾力的ジョブを拡張する。
  • 依存するアイテム価値を持つナップサックベースのヒューリスティクスを適用し、サーバー回収時のプリエンプションコストを最小化。プリエンプション影響が小さいジョブを優先する。
  • ワーカー-サーバー配置にベストフィットデクリーディングポolicを採用し、異種GPUサーバー間での断片化を低減する。
  • 実行時間予測を活用し、予測誤差に対しても耐性を示す。60%の誤った予測(誤差25%以内)があっても、依然としてベースラインと比較して1.76倍のキューイング遅延短縮効果を維持する。

実験結果

リサーチクエスチョン

  • RQ1推論サービス品質を損なわずに、アイドル状態の推論GPUクラスタをトレーニングジョブに効果的に貸し出せるか?
  • RQ2交通量の急増時に貸し出されたサーバーを回収する際、プリエンプションコストをいかに最小化できるか?
  • RQ3追加のGPUを弾力的トレーニングジョブに割り当てる最適な戦略は何か? これによりジョブ完了時間を最小限に抑えられるか?
  • RQ4非弾力的および弾力的ジョブが共存する状況で、異種GPUの利用可能性をどのように処理するか?
  • RQ5ジョブ実行時間の予測誤差に対して、スケジューラーはどれほど頑健か?

主な発見

  • Arylは、容量貸し出しや弾力的スケーリングを実装しないベースラインスケジューラーと比較して、平均キューイング時間を1.53倍短縮し、ジョブ完了時間を1.50倍短縮する。
  • 15日間の50,000件を超える本番環境ジョブトレースを用いた大規模シミュレーションでは、クラスタ利用率が最大26.9%向上する。
  • 実行時間予測が60%誤差がある場合(誤差25%以内)でも、Arylはベースラインと比較してキューイング遅延を1.76倍短縮し、安定した性能向上を達成する。
  • ナップサックベースのプリエンプションヒューリスティクスにより、サーバー回収時のプリエンプションコストが効果的に低減され、ジョブの中断が最小限に抑えられる。
  • 弾力的ジョブのスケーリングに複数選択型ナップサック定式化を適用した結果、実用的にJCTを最小化する効果が確認され、多くの場合、動的計画法で解ける。
  • 本システムは予測誤差に対しても頑健であり、現実的なワークロード条件下でも顕著な性能向上を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。