Skip to main content
QUICK REVIEW

[論文レビュー] Low-latency job scheduling with preemption for the development of deep learning

Hidehito Yabuuchi, Daisuke Taniwaki|arXiv (Cornell University)|Feb 5, 2019
Cloud Computing and Resource Management参考文献 8被引用数 6
ひとこと要約

この論文では、リソース要件と再開可能性に基づいて、ベストエフォート(BE)ジョブを的確にプリエンプトすることで、ディープラーニングワークロードにおける試行錯誤(TE)ジョブの遅延を低減する低遅延ジョブスケジューリングアルゴリズムFitGppを提案する。FIFOと比較して、TEジョブの95百分位遅延が96.6%削減された一方、BEジョブの中央値遅延は18.0%、95百分位遅延は23.9%増加にとどまった。

ABSTRACT

One significant challenge in the job scheduling of computing clusters for the development of deep learning algorithms is the efficient scheduling of trial-and-error (TE) job, the type of job in which the users seek to conduct small-scale experiments while monitoring their processes. Unfortunately, the existing job schedulers to date do not feature well-balanced scheduling for the mixture of TE jobs and best-effort (BE) jobs, or they can handle the mixture in limited situations at most. To fill in this niche, we propose an algorithm that can significantly reduce the latency of TE jobs in versatile situations without greatly elongating the slowdown of the BE jobs. Our algorithm efficiently schedules both TE and BE jobs by selectively preempting the BE jobs that can be, when the time comes, resumed without much delay. In our simulation study with synthetic and real workloads, we were able to reduce the 95th percentile of the slowdown rates for the TE jobs in the standard FIFO strategy by 96.6%, while compromising the median of the BE slowdown rates by only 18.0% and the 95th percentile by only 23.9%.

研究の動機と目的

  • ディープラーニングクラスタにおける低遅延の試行錯誤(TE)ジョブと高スループットのベストエフォート(BE)ジョブの間のスケジューリングの不均衡を解消すること。
  • 特に混合ワークロードにおいて、BEジョブの遅延を著しく増加させることなく、TEジョブの遅延を低減すること。
  • プリエンプション頻度を制限し、再開可能なジョブを選択することで、BEジョブのスターヴェーションを回避するプリエンプション戦略の設計。
  • すべてのリダクションアーキテクチャを採用するさまざまなディープラーニングフレームワークに対しても効率的なスケジューリングを可能にすること。
  • 実際のクラスタワークロードと動的なリソース要件に対応できる実用的で生産環境対応のソリューションを提供すること。

提案手法

  • FitGppアルゴリズムは、リソース消費量が低く、再開可能性が高いジョブを優先するスコア関数を用いて、プリエンプト対象のBEジョブを選択する。
  • 選択されたBEジョブは動的に一時停止され、空いたGPUリソースが保留中のTEジョブに即座に割り当てられる。
  • スターヴェーションを防ぎ、公平性を確保するため、1つのBEジョブあたりの最大プリエンプション回数を制限する。
  • プリエンプションの攻撃性を制御するパラメータ's'を用い、TEジョブの応答性とBEジョブの遅延のバランスを取る。
  • 実行時間の推定が不要であるため、ディープラーニングジョブで一般的なハイパーパramータ感受性に対しても頑健である。
  • 合成ワークロードと実世界ワークロード(大学クラスタからのトレースを含む)の両方をサポートし、さまざまなディープラーニングフレームワークと互換性がある。

実験結果

リサーチクエスチョン

  • RQ1混合ディープラーニングワークロードにおいて、プリエンプションベースのスケジューラーは、BEジョブの遅延を著しく増加させることなく、TEジョブの遅延を顕著に低減できるか?
  • RQ2プリエンプション閾値パラメータ's'の選択が、TEジョブの応答性とBEジョブパフォーマンスのトレードオフにどのように影響するか?
  • RQ3実行時間の変動が大きい長時間実行のBEジョブが含まれるワークロードにおいて、プリエンプションがTEジョブ遅延をどの程度低減できるか?
  • RQ4さまざまなワークロード比率とGP長の分布において、BEジョブの遅延が常に低く抑えられるか?
  • RQ5実際のクラスタトレースにおいて、非プリエンプションのFIFOおよびLRTPやRANDなどの他のプリエンプション戦略と比較して、このアルゴリズムは優れた性能を示せるか?

主な発見

  • s=4.0でFitGppを適用した場合、FIFOと比較してTEジョブの95百分位遅延が96.6%削減され、遅延率は2080から9.00に低下した。
  • FitGppを用いることで、BEジョブの中央値遅延が29.6%削減され、FIFOの16.2から11.4に低下した。
  • BEジョブの95百分位遅延は、FitGppを用いることで18.0%増加(443から372に)にとどまり、中央値遅延の16.0%減少と比較して良好な結果を示した。
  • FitGppは、TEジョブの割合が変化しても、常に他のアルゴリズムを上回る性能を維持し、ワークロードの混合割合にかかわらず低遅延を実現した。
  • GP長の分布の変動に対しても、FitGppの性能は頑健であり、s=8.0を用いることで、長時間GP下でのTEジョブ遅延の増加を効果的に抑制できた。
  • 実クラスタトレース評価では、FitGppはFIFOと比較してBEジョブの95百分位遅延を16.0%低減し、TEジョブの95百分位遅延をわずか9.00にまで低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。