Skip to main content
QUICK REVIEW

[論文レビュー] CASSINI: Network-Aware Job Scheduling in Machine Learning Clusters

Sudarsanan Rajasekaran, Manya Ghobadi|arXiv (Cornell University)|Aug 1, 2023
Cloud Computing and Resource Management被引用数 6
ひとこと要約

Cassini は、機械学習クラスタ用のネットワークに配慮したジョブスケジューラであり、幾何的抽象化とアフィニティグラフを用いて、共有ネットワークリンク上の共配置ジョブの通信フェーズを相互に重ね合わせ、混雑を軽減し、学習効率を向上させる。Cassini は、コンgestion制御の変更やネットワークインfraの変更なしに、尾部完了時間を最大 2.5× まで短縮し、ECNマーキングパケットを最大 33× 減少させる。

ABSTRACT

We present CASSINI, a network-aware job scheduler for machine learning (ML) clusters. CASSINI introduces a novel geometric abstraction to consider the communication pattern of different jobs while placing them on network links. To do so, CASSINI uses an affinity graph that finds a series of time-shift values to adjust the communication phases of a subset of jobs, such that the communication patterns of jobs sharing the same network link are interleaved with each other. Experiments with 13 common ML models on a 24-server testbed demonstrate that compared to the state-of-the-art ML schedulers, CASSINI improves the average and tail completion time of jobs by up to 1.6x and 2.5x, respectively. Moreover, we show that CASSINI reduces the number of ECN marked packets in the cluster by up to 33x.

研究の動機と目的

  • 深層学習ワークロードにおけるモデルおよびデータサイズの増大に起因するGPUクラスタ内の増大するネットワーク混雑を解決すること。
  • 既存のMLスケジューラがジョブをネットワークリンクに配置する際、通信パターンを無視するという制限を克服すること。
  • 複数のMLジョブを共有ネットワークリンクに効率的に共配置できるように、それらの通信フェーズ間の干渉を最小限に抑える仕組みを提供すること。
  • 既存のスケジューラ(例:Themis や Pollux)と連携可能なスケーラブルでプラグイン可能なスケジューラ拡張機能を設計すること。ネットワークハードウェアやコンgestion制御プロトコルの変更は不要である。
  • 平均および尾部ジョブ完了時間に顕著な性能向上を達成するとともに、ECNマーキングパケットなどのネットワーク混雑指標を低減すること。

提案手法

  • 各ジョブの周期的通信パターンを円としてモデル化する幾何的抽象化を導入し、時間はトレーニングイテレーション時間に比例して円周に沿って折りたたまれる。
  • これらの円の回転を用いて、同じネットワークリンクを共有するジョブ間で通信フェーズを最適に重ね合わせるための時間シフトを特定する。
  • 最適な回転後の通信フェーズの重なり具合に基づいて、ジョブ間の適合スコアを定義し、干渉を最小限に抑えるスケジューリング意思決定を可能にする。
  • ノードがジョブおよびネットワークリンクを表し、エッジがジョブがリンクを通過することを示す二部グラフ(bipartite)アフィニティグラフを構築し、クラスタ全体のスケジューリング調整を可能にする。
  • すべての共有リンクで同時に適合性を維持するように、すべてのジョブに固有の時間シフトを計算する新しいグラフ走査アルゴリズムを開発する。
  • Themis や Pollux などの既存スケジューラに、軽量なモジュール(約 1000 行のコード)として Cassini を統合し、元のスケジューリング論理を保ちながらネットワークに配慮した配置意思決定を追加する。
Figure 1: The traffic pattern of different parallelization strategies when training GPT-1, GPT-2, and GPT-3 models.
Figure 1: The traffic pattern of different parallelization strategies when training GPT-1, GPT-2, and GPT-3 models.

実験結果

リサーチクエスチョン

  • RQ1幾何的抽象化は、共有ネットワークリンク上で複数のMLジョブの通信フェーズの重ね合わせを効果的にモデル化・最適化できるか?
  • RQ2ネットワーク競合を最小限に抑えるジョブ配置意思決定を導くために、適合性メトリクスをどのように定義・計算できるか?
  • RQ3提案手法は、コンgestion制御やネットワークインfraの変更なしに、尾部完了時間とECNマーキングパケットを削減できるか?
  • RQ4本手法は、データ並列、モデル並列、パイプライン並列などの異なる並列化戦略および多様なDNNアーキテクチャにどの程度一般化できるか?
  • RQ5既存スケジューラとのCassini統合が、実際のクラスタワークロードにおけるエンドツーエンドの学習パフォーマンスにどのように影響を与えるか?

主な発見

  • 24サーバーのテストベッドにおいて、Cassini は Pollux より最大 2.5×、Themis より最大 2.2× の尾部完了時間の短縮を達成した。
  • 平均ジョブ完了時間は、最先端のスケジューラと比較して最大 1.6× まで向上した。
  • クラスタ全体のECNマーキングパケット数は最大 33× 減少し、ネットワーク混雑の顕著な低減が確認された。
  • 幾何的抽象化と適合スコアリング機構により、ジョブが同じGPUを共有していなくても通信フェーズの重ね合わせが可能となり、Muri らの先行研究の制限を克服した。
  • 本手法は、既存の通信最適化技術と直交しており、コンgestion制御やネットワークハードウェアの変更なしに、既存スケジューラと統合可能である。
  • VGG、ResNet、BERT、GPT-1/2/3、DLRM など多様なDNNモデルに一般化可能であり、一般的なMLワークロードに広範に適用可能であることが実証された。
Figure 2: Impact of interleaving the Up-Down phases of two VGG19 jobs sharing link $l_{1}$ .
Figure 2: Impact of interleaving the Up-Down phases of two VGG19 jobs sharing link $l_{1}$ .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。