Skip to main content
QUICK REVIEW

[論文レビュー] Online Job Scheduling in Distributed Machine Learning Clusters

Yixin Bao, Yanghua Peng|arXiv (Cornell University)|Jan 3, 2018
Cloud Computing and Resource Management参考文献 19被引用数 13
ひとこと要約

本論文では、分散機械学習クラスタ向けのオンラインジョブスケジューリングアルゴリズムOASiSを提案する。OASiSは、学習中の作業者(workers)およびパラメータサーバー(parameter servers)の数を動的に調整することで、長期的なジョブ効用を最大化する。プライマル・デュアルフレームワークを用い、効率的なデュアルサブルーチンを実装することで、多項式時間の計算量を達成し、シミュレーションおよび実験環境でのテストで標準的なスケジューラーを上回る性能を示した。これにより、リソースの効率的利用とジョブ完了時間の短縮が実現された。

ABSTRACT

Nowadays large-scale distributed machine learning systems have been deployed to support various analytics and intelligence services in IT firms. To train a large dataset and derive the prediction/inference model, e.g., a deep neural network, multiple workers are run in parallel to train partitions of the input dataset, and update shared model parameters. In a shared cluster handling multiple training jobs, a fundamental issue is how to efficiently schedule jobs and set the number of concurrent workers to run for each job, such that server resources are maximally utilized and model training can be completed in time. Targeting a distributed machine learning system using the parameter server framework, we design an online algorithm for scheduling the arriving jobs and deciding the adjusted numbers of concurrent workers and parameter servers for each job over its course, to maximize overall utility of all jobs, contingent on their completion times. Our online algorithm design utilizes a primal-dual framework coupled with efficient dual subroutines, achieving good long-term performance guarantees with polynomial time complexity. Practical effectiveness of the online algorithm is evaluated using trace-driven simulation and testbed experiments, which demonstrate its outperformance as compared to commonly adopted scheduling algorithms in today's cloud systems.

研究の動機と目的

  • 静的リソース割り当てによる制限が学習速度を制限する共有MLクラスタにおけるリソース利用効率の悪さという課題に対処すること。
  • ジョブ実行中に適応的にリソース割り当てを調整するオンラインスケジューリングアルゴリズムを設計し、学習効率およびクラスタ全体の効用を向上させること。
  • ジョブ効用とリソースコストに基づいた動的アドミッション意思決定を可能にし、長期的なパフォーマンス最適化を実現すること。
  • KubernetesベースのMXNetプロトタイプを用いたトレース駆動型シミュレーションおよび実環境実験を通じて、アルゴリズムの有効性を評価すること。

提案手法

  • OASiSは、リアルタイムでのスケジューリング意思決定を実現するため、プライマル・デュアル最適化フレームワークを採用し、ジョブ効用とリソースコストのバランスをとる。
  • アルゴリズムは、将来のリソース利用可能性とジョブ効用を予測して、各ジョブの並列実行中の作業者およびパラメータサーバーの数を動的に調整する。
  • 多項式時間計算量でオンライン最適化問題を効率的に解くために、デュアルサブルーチンを用いる。
  • リソースの価格をシグナルとして用い、リソースが不足している場合には低効用ジョブをフィルタリングする意思決定を支援する。
  • Kubernetesと統合し、MXNetを変更して、実行時における作業者およびパラメータサーバー数の再設定を可能にする。
  • ジョブ効用は完了時間の関数としてモデル化され、優先度の高いジョブがより良いスケジューリング待遇を受ける。

実験結果

リサーチクエスチョン

  • RQ1動的リソース利用可能性に適応しながら、長期的な効用を最大化するように分散MLクラスタにおけるオンラインジョブスケジューリングを最適化する方法は何か?
  • RQ2実世界のMLワークロードにおいて、固定割り当てと比較して、動的スケーリングによる作業者およびパラメータサーバーのスケーリングによる性能向上はどの程度か?
  • RQ3OASiSアルゴリズムは、FIFO、DRF、RRHといった標準スケジューラーと比較して、ジョブ効用および完了時間の迅速性においてどの程度優れているか?
  • RQ4ジョブ効用対リソース比の推定誤差が、アルゴリズムの競合比およびパフォーマンスに与える影響は何か?

主な発見

  • OASiSは、オフライン最適解と比較して1.1~1.5の性能比を達成し、現実的な条件下でも優れた競合性能を示した。
  • リソース制約下では、効用対リソース比を低く見積もると、過大評価するよりも総効用が高くなる。これは、ジョブのフィルタリングが減少するためである。
  • 10時間スロットにわたり12ジョブを対象とした実験環境での実験では、OASiSはFIFO、DRF、RRHスケジューラーと比較して、より高い総ジョブ効用と優れた完了時間の迅速性を示した。
  • 100時間スロットおよび80台のサーバーに対して、OASiSは1秒未満で実行可能であり、最適化問題の複雑さにもかかわらず実用的なスケーラビリティを示した。
  • シミュレーション結果から、OASiSは不確実なジョブ効用推定値に対しても、多項式時間計算量を維持し、良好な長期的パフォーマンス保証を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。