Skip to main content
QUICK REVIEW

[論文レビュー] Shockwave: Fair and Efficient Cluster Scheduling for Dynamic Adaptation in Machine Learning

Pengfei Zheng, Rui Pan|arXiv (Cornell University)|Sep 30, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

Shockwaveは、動的リソース適応を伴う機械学習ジョブを実行するGPUクラスタにおいて、公平性と効率性を同時に最適化する予防的で市場理論に基づくスケジューラーである。時間変動する効用関数を扱うためにフィッシャー市場均衡を拡張し、ベイズ予測を用いた確率的動的プログラミングを適用することで、トレース駆動実験および実クラスタ実験において、既存のスケジューラーよりもマケスパンを1.3倍短縮し、公平性を2倍向上させた。

ABSTRACT

Dynamic adaptation has become an essential technique in accelerating distributed machine learning (ML) training. Recent studies have shown that dynamically adjusting model structure (e.g., lottery ticket hypothesis) or hyperparameters (e.g., batch size) can significantly accelerate training without sacrificing accuracy. However, existing ML cluster schedulers are not designed to handle dynamic adaptation. We show that existing schemes fail to provide fairness and degrade system efficiency when the training throughput changes over time under dynamic adaptation. We design Shockwave, a scheduler with future planning that builds on two key ideas. First, Shockwave extends classic market theory from static settings to dynamic settings to co-optimize efficiency and fairness. Second, Shockwave utilizes stochastic dynamic programming to handle dynamic changes. We build a system for Shockwave and validate its performance with both trace-driven simulation and cluster experiments. Results show that for traces of ML jobs with dynamic adaptation, Shockwave improves makespan by 1.3X and fairness by 2X when compared with existing fair scheduling schemes.

研究の動機と目的

  • 機械学習ジョブの動的適応(例:バッチサイズの変更)に対応する際、既存のクラスタースケジューラーが示す公平性と効率性の欠如に対処すること。
  • 反応的対応ではなく、将来のリソース需要を事前に計画するスケジューラーを設計すること。
  • 時間変動するジョブ効用とリソース要件の下で、長期的な公平性とシステム効率性を同時に最適化すること。
  • 予測誤差やジョブ動作の動的変化に対して耐性を持つこと。
  • トレース駆動シミュレーションおよび実クラスタ実験を通じて、スケジューラーの優位性を検証すること。

提案手法

  • 各ジョブが等しい予算を持つ離散時刻の動的フィッシャーマーケットを定式化し、市場が均衡に達することで効率性と公平性が保証される。
  • 時間変動するジョブ効用(例:バッチサイズスケーリングによるスループット変化)を扱うために、古典的市場理論を拡張し、確率的動的プログラミングを用いる。
  • ベイズ統計と補間を用いて、動的適応下でのジョブ実行時間とスケジューリングの余裕を予測する。
  • 制限時間制御付きソルバー(例:Gurobi)を用いて、最適解からのギャップが有界な近似最適割り当てを計算し、スケジューリングのオーバーヘッドを最小限に抑える。
  • 偏ったジョブ進捗をペナルティ化するナッシュ社会的福祉目的関数を導入し、慎重で公平な割り当て意思決定を促進する。
  • 将来の効用変化を計画することで、効率性を損なう再優先順位付けを避けるために、ラウンドごとにジョブを前もってスケジューリングする。

実験結果

リサーチクエスチョン

  • RQ1機械学習ジョブが時間経過とともにリソース要件を変化させる状況下でも、市場ベースのスケジューラーは公平性と効率性を維持できるか?
  • RQ2将来の計画を組み込んだ予防的スケジューリングは、反応的または静的スケジューリングに比べて、動的適応ワークロードでどのように異なるか?
  • RQ3ジョブ実行時間推定における予測誤差が、スケジューラーの公平性と効率性に及ぼす影響の程度はどの程度か?
  • RQ4時間変動する効用を扱う動的マーケット定式化は、DRF、Themis、AlloXなどの既存の公平スケジューラーよりも優れたシステム全体のパフォーマンスを達成できるか?
  • RQ5ソルバーのオーバーヘッドとリアルタイム性能は、このようなスケジューラーを生産環境クラスタに実装する上でどのような影響を及ぼすか?

主な発見

  • トレース駆動シミュレーションにおいて、ShockwaveはThemis、Gavel、AlloXなどの最先端の公平スケジューラーよりもマケスパンを1.3倍短縮した。
  • 動的適応下において、F値(FTF)および不公正にスケジュールされたジョブの割合という指標で測定した公平性が、既存のスケジューラーよりも2倍向上した。
  • ソルバーのオーバーヘッドは極めて小さく、500ジョブでは15秒のタイムアウトでギャップがたった0.03%、2000ジョブでは0.44%に留まり、高いスケーラビリティと低レイテンシを示した。
  • Shockwaveは予測誤差に対しても耐性を示した:実行時間推定に±100%のノイズが加わっても公平性はゆっくりと低下し、ベースラインと同等のパフォーマンスを維持した。
  • 反応的アプローチに比べ、Shockwaveの予防的計画が顕著に優れていた。反応的再優先順位付けでは、初期の非効率性を補うことができなかった。
  • ナッシュ社会的福祉の活用により、不均衡なジョブ進捗をペナルティ化することで、強い公平性が確保され、慎重で公平なスケジューリング意思決定が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。