Skip to main content
QUICK REVIEW

[论文解读] CASSINI: Network-Aware Job Scheduling in Machine Learning Clusters

Sudarsanan Rajasekaran, Manya Ghobadi|arXiv (Cornell University)|Aug 1, 2023
Cloud Computing and Resource Management被引用 6
一句话总结

Cassini 是一种面向机器学习集群的网络感知型作业调度器,利用几何抽象和亲和图,在共享网络链路上交错执行共置作业的通信阶段,从而减少拥塞并提升训练效率。它将尾部完成时间缩短最多 2.5 倍,将 ECN 标记的数据包减少最多 33 倍,且无需修改拥塞控制机制或网络基础设施。

ABSTRACT

We present CASSINI, a network-aware job scheduler for machine learning (ML) clusters. CASSINI introduces a novel geometric abstraction to consider the communication pattern of different jobs while placing them on network links. To do so, CASSINI uses an affinity graph that finds a series of time-shift values to adjust the communication phases of a subset of jobs, such that the communication patterns of jobs sharing the same network link are interleaved with each other. Experiments with 13 common ML models on a 24-server testbed demonstrate that compared to the state-of-the-art ML schedulers, CASSINI improves the average and tail completion time of jobs by up to 1.6x and 2.5x, respectively. Moreover, we show that CASSINI reduces the number of ECN marked packets in the cluster by up to 33x.

研究动机与目标

  • 解决深度学习工作负载中因模型和数据规模增大而导致的 GPU 集群网络拥塞问题。
  • 克服现有机器学习调度器在将作业放置到网络链路时忽略通信模式的局限性。
  • 通过最小化通信阶段之间的干扰,实现在共享网络链路上高效共置多个机器学习作业。
  • 设计一种可扩展、可插拔的调度器扩展模块,可与现有调度器(如 Themis 和 Pollux)集成,无需修改网络硬件或拥塞控制协议。
  • 在平均和尾部作业完成时间方面实现显著性能提升,同时降低 ECN 标记数据包等网络拥塞指标。

提出的方法

  • 提出一种几何抽象,将每个作业的周期性通信模式建模为一个圆,其中时间按训练迭代时间成比例地环绕圆周。
  • 通过旋转这些圆来寻找最优的时间偏移量,以最大化共享同一网络链路的作业之间通信阶段的交错程度。
  • 基于最优旋转后通信阶段的重叠程度,定义作业之间的兼容性评分,从而支持智能的调度决策。
  • 构建一个二分图亲和图,其中节点代表作业和网络链路,边表示作业在链路上的传输,实现全集群范围的调度协调。
  • 开发一种新型图遍历算法,为所有作业计算唯一的时移量,确保在所有共享链路上同时保持兼容性。
  • 将 Cassini 作为轻量级模块(约 1000 行代码)集成到现有调度器(如 Themis 和 Pollux)中,保留其原有调度逻辑的同时增加网络感知的作业放置决策。
Figure 1: The traffic pattern of different parallelization strategies when training GPT-1, GPT-2, and GPT-3 models.
Figure 1: The traffic pattern of different parallelization strategies when training GPT-1, GPT-2, and GPT-3 models.

实验结果

研究问题

  • RQ1几何抽象能否有效建模并优化多个机器学习作业在共享网络链路上的通信阶段交错?
  • RQ2如何定义并计算兼容性度量,以指导最小化网络竞争的作业放置决策?
  • RQ3所提出的方法是否能在不修改拥塞控制或网络基础设施的前提下,减少尾部完成时间和 ECN 标记的数据包?
  • RQ4该方法在不同并行策略(如数据并行、模型并行、流水线并行)以及多样化 DNN 架构中的泛化能力如何?
  • RQ5Cassini 与现有调度器集成后,对真实集群工作负载的端到端训练性能有何影响?

主要发现

  • 在 24 台服务器的测试环境中,Cassini 相较于 Pollux 将机器学习作业的尾部完成时间缩短最多 2.5 倍,相较于 Themis 缩短最多 2.2 倍。
  • 与最先进的调度器相比,平均作业完成时间最多提升 1.6 倍。
  • Cassini 将集群中 ECN 标记的数据包数量最多减少 33 倍,表明网络拥塞显著降低。
  • 几何抽象与兼容性评分机制成功实现了即使作业不共享相同 GPU 的通信阶段交错,克服了 Muri 等先前工作存在的局限性。
  • 该方法与现有通信优化技术正交,可无缝集成到现有调度器中,无需修改拥塞控制或网络硬件。
  • 该方法在多种 DNN 模型(包括 VGG、ResNet、BERT、GPT-1/2/3 和 DLRM)上均表现良好,证明了其在常见机器学习工作负载中的广泛适用性。
Figure 2: Impact of interleaving the Up-Down phases of two VGG19 jobs sharing link $l_{1}$ .
Figure 2: Impact of interleaving the Up-Down phases of two VGG19 jobs sharing link $l_{1}$ .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。