Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Optimize DAG Scheduling in Heterogeneous Environment

Jinhong Luo, Zhou, Yunfan|arXiv (Cornell University)|Mar 9, 2021
Cloud Computing and Resource Management参考文献 18被引用数 5
ひとこと要約

本稿では、DAGワークロードにおけるタスク依存関係をグラフニューラルネットワーク(GNN)で認識し、異種クラスタにおけるタスクの複製とエグゼキューター割り当てにヒューリスティックルールを用いる、2段階の強化学習ベースのアルゴリズムLACHESISを提案する。最良の既存ベースラインと比較して、マケスパンを最大26.7%削減し、スループットを35.2%向上する。

ABSTRACT

Scheduling job flows efficiently and rapidly on distributed computing clusters is one of huge challenges for daily operation of data centers. In a practical scenario, a single job consists of numerous stages with complex dependency relation represented as a Directed Acyclic Graph (DAG) structure. Nowadays a data center usually equips with a cluster of heterogeneous computing servers which are different in the hardware/software configuration. From both the cost saving and environmental friendliness, the data centers could benefit a lot from optimizing the job scheduling problems in the heterogeneous environment. Thus the problem has attracted more and more attention from both the industry and academy. In this paper, we propose a task-duplication based learning algorithm, namely \lachesis \footnote{The second of the Three Fates in ancient Greek mythology, who determines destiny.}, aiming to optimize the problem. In the proposed approach, it first perceives the topological dependencies between jobs using a reinforcement learning framework and a specially designed graph neural network (GNN) to select the most promising task to be executed. Then the task is assigned to a specific executor with the consideration of duplicating all its precedent tasks according to an expert-designed rules. We have conducted extensive experiments over standard workloads to evaluate the proposed solution. The experimental results suggest that \lachesisquad can achieve at most 26.7\% reduction of makespan and 35.2\% improvement of speedup ratio over seven strong baseline algorithms, including the state-of-the-art heuristics methods and a variety of deep reinforcement learning based algorithms.

研究の動機と目的

  • 異種コンピューティング環境における多様なエグゼキューター能力を有する状況下で、効率的なDAGジョブスケジューリングを実現すること。
  • タスク複製と動的エグゼキューター割り当てを活用して、マケスパンを短縮し、スループットを向上させること。
  • リアルタイムデータセンタワークロードにおける複雑で動的かつ大規模なジョブ依存関係に適応可能な学習ベースのスケジューリングフレームワークを設計すること。
  • バッチおよび連続的ジョブ到着の両状況において、既存のヒューリスティックおよび深層強化学習ベースのスケジューリングアルゴリズムを上回ること。

提案手法

  • グラフニューラルネットワーク(GNN)を用いてDAGタスクのトポロジカル構造を符号化し、依存関係を捉える。
  • 強化学習のポリシーネットワークが、GNNでエンコードされた状態表現に基づいて次に実行するタスクを選択する。
  • ヒューリスティックルールが、選択されたタスクの最適なエグゼキューターを決定し、通信オーバーヘッドを低減するための先行タスクの複製の有無も含めて判断する。
  • タスク複製を戦略的に適用することで、計算コストと通信コストのバランスを取ることで、エンドツーエンドのジョブ完了時間を最小化する。
  • 2段階パイプラインとしてフレームワークを実装する:(1) RLポリシーによるタスク選択、(2) 専門家が設計したルールを用いた複製意思決定とエグゼキューター割り当て。
  • 標準ワークロードおよび実際のデータセンターパattersを用いて、バッチモードおよび連続的ジョブ到着モードの両方で評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1強化学習とGNNを組み合わせることで、異種スケジューリング環境における複雑なDAG依存関係をどの程度効果的にモデル化できるか?
  • RQ2非複製ベースラインと比較して、タスク複製は異種クラスタ環境におけるマケスパンとスループットにどの程度の向上効果をもたらすか?
  • RQ3最新の深層学習およびヒューリスティックスケジューリング手法と比較して、提案手法LACHESISの性能と推論時間はどのように異なるか?
  • RQ4大規模で動的変化するワークロードにスケーリングする際、学習ベースのアプローチは低遅延を維持できるか?

主な発見

  • LACHESISは、すべてのテストシナリオにおいて最良のベースラインアルゴリズムと比較して、マケスパンを最大26.7%削減した。
  • LACHESISのスループット比は、2番目に優れたアルゴリズムを最大35.2%上回り、優れたスケーラビリティと効率性を示した。
  • バッチモードでは、LACHESISの98%の意思決定が30ms未満で完了しており、優れたリアルタイム性能を示した。
  • 連続モードでは、2番目に優れたアルゴリズムと比較して、平均マケスパンを最大7.4%削減し、動的ワークロードにおける強靭性を示した。
  • LACHESISのSLR(スループット損失比)は、評価されたすべてのアルゴリズムの中で常に最低であり、高いスケジューリング品質を示した。
  • 特に大規模かつ連続的ジョブ到着環境において、LACHESISは複製戦略とエグゼキューター選択戦略の有効性により、Decima-DEFTのような高度なモデルでさえも上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。