Skip to main content
QUICK REVIEW

[论文解读] Themis: Fair and Efficient GPU Cluster Scheduling

Kshiteej Mahajan, Arjun Balasubramanian|arXiv (Cornell University)|Jul 2, 2019
Stochastic Gradient Optimization TechniquesComputer Science参考文献 36被引用 22
一句话总结

Themis 通过引入完成时间公平性——一种长期公平性度量,确保每个机器学习应用的完成时间与在私有集群上运行时相当——提出了一种公平且高效的 GPU 集群调度方案。它采用两级基于拍卖的调度架构,应用程序根据放置偏好对 GPU 资源出价,通过部分分配拍卖机制,同时实现短期效率与长期公平性,激励诚实出价。

ABSTRACT

Modern distributed machine learning (ML) training workloads benefit significantly from leveraging GPUs. However, significant contention ensues when multiple such workloads are run atop a shared cluster of GPUs. A key question is how to fairly apportion GPUs across workloads. We find that established cluster scheduling disciplines are a poor fit because of ML workloads' unique attributes: ML jobs have long-running tasks that need to be gang-scheduled, and their performance is sensitive to tasks' relative placement. We propose Themis, a new scheduling framework for ML training workloads. It's GPU allocation policy enforces that ML workloads complete in a finish-time fair manner, a new notion we introduce. To capture placement sensitivity and ensure efficiency, Themis uses a two-level scheduling architecture where ML workloads bid on available resources that are offered in an auction run by a central arbiter. Our auction design allocates GPUs to winning bids by trading off efficiency for fairness in the short term but ensuring finish-time fairness in the long term. Our evaluation on a production trace shows that Themis can improve fairness by more than 2.25X and is ~5% to 250% more cluster efficient in comparison to state-of-the-art schedulers.

研究动机与目标

  • 解决现有集群调度器(如 DRF、Quincy)在处理具有放置敏感性的长期运行、组调度机器学习工作负载时的不足。
  • 提出完成时间公平性作为新的长期公平性度量,确保每个机器学习应用的性能与独占使用集群 1/N 资源时相当。
  • 设计一种调度框架,在尊重机器学习作业的放置偏好前提下,平衡短期效率与长期公平性。
  • 通过诚实拍卖机制确保资源配置的帕累托效率和无嫉妒性。
  • 通过两级调度架构(集中式仲裁器与应用级出价轮次)实现实际部署。

提出的方法

  • 在租约到期时触发逐轮拍卖机制,应用程序根据其预测的完成时间公平性对可用 GPU 资源出价。
  • 使用部分分配拍卖机制,从设计上确保诚实性、帕累托效率和无嫉妒性,通过隐藏支付机制抑制策略性虚假申报。
  • 允许应用程序通过反映不同 GPU 配置下预期性能的出价值,表达放置偏好(如密集或交错放置)。
  • 实施两级调度架构:集中式应用间调度器(仲裁器)和每个应用内部的调度器,负责基于租约的任务执行管理。
  • 根据公平性旋钮 f 的指标,过滤掉完成时间公平性最差的应用,优先调度最需要的应用,从而提升整体公平性。
  • 采用基于租约的调度(默认 10 分钟),在最小化开销的同时支持检查点和资源重新分配。

实验结果

研究问题

  • RQ1如何为具有放置敏感性的长期运行、组调度机器学习工作负载有意义地定义公平性?
  • RQ2调度系统能否在不牺牲放置感知性能的前提下,同时实现短期效率与长期公平性?
  • RQ3在针对机器学习工作负载的动态、多轮 GPU 拍卖中,如何激励诚实出价?
  • RQ4租约时长和公平性旋钮调节对公平性和集群利用率有何影响?
  • RQ5所提出的拍卖机制在公平性和效率方面相较于最先进调度器的优越程度如何?

主要发现

  • 在生产 trace 上,Themis 相较于最先进调度器,公平性提升超过 2.25 倍。
  • Themis 的集群效率比现有调度器高出 5% 至 250%,具体取决于工作负载特征。
  • 部分分配拍卖机制成功激励了诚实出价,因为欺骗策略仅在一定程度内(X ≤ 34%)对欺骗者有利,超过后其将损失大量资源。
  • 将公平性旋钮 f = 0.8 和租约时间 = 10 分钟设为最优权衡,避免了在 f = 1.0 时因出价竞争减少而导致的性能下降。
  • 更短的租约时间通过减少排队延迟提升了公平性,而更高的租约值通过降低检查点频率提升了效率。
  • 系统从设计上保持了帕累托效率和无嫉妒性,确保没有任何应用能在不损害其他应用的前提下改善自身结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。