[论文解读] Shockwave: Fair and Efficient Cluster Scheduling for Dynamic Adaptation in Machine Learning
Shockwave 是一种基于市场理论的主动式调度器,通过动态资源自适应协同优化 GPU 集群中机器学习作业的公平性与效率。通过将 Fisher 市场均衡扩展至时变效用函数,并结合基于贝叶斯预测的随机动态规划,Shockwave 在基于 trace 的实验和真实集群实验中,将完成时间缩短了 1.3 倍,公平性提升 2 倍,优于现有调度器。
Dynamic adaptation has become an essential technique in accelerating distributed machine learning (ML) training. Recent studies have shown that dynamically adjusting model structure (e.g., lottery ticket hypothesis) or hyperparameters (e.g., batch size) can significantly accelerate training without sacrificing accuracy. However, existing ML cluster schedulers are not designed to handle dynamic adaptation. We show that existing schemes fail to provide fairness and degrade system efficiency when the training throughput changes over time under dynamic adaptation. We design Shockwave, a scheduler with future planning that builds on two key ideas. First, Shockwave extends classic market theory from static settings to dynamic settings to co-optimize efficiency and fairness. Second, Shockwave utilizes stochastic dynamic programming to handle dynamic changes. We build a system for Shockwave and validate its performance with both trace-driven simulation and cluster experiments. Results show that for traces of ML jobs with dynamic adaptation, Shockwave improves makespan by 1.3X and fairness by 2X when compared with existing fair scheduling schemes.
研究动机与目标
- 解决现有集群调度器在处理具有动态自适应能力的机器学习作业(如批量大小变化)时存在的公平性与效率不足问题。
- 设计一种主动规划未来资源需求而非被动响应的调度器。
- 在作业效用与资源需求随时间动态变化的背景下,协同优化长期公平性与系统效率。
- 确保对预测误差和作业行为动态变化的鲁棒性。
- 通过基于 trace 的仿真与真实集群实验,验证该调度器的优越性。
提出的方法
- 构建离散时间动态 Fisher 市场,其中每个作业拥有相等预算,市场通过清算实现均衡,确保效率与公平性。
- 将经典市场理论扩展至处理时变作业效用(例如,因批量大小缩放导致吞吐量变化),采用随机动态规划方法。
- 利用贝叶斯统计与插值技术,预测作业运行时间和动态自适应下的调度松弛时间。
- 使用超时控制的求解器(如 Gurobi)计算接近最优的资源分配,保证与最优解的差距有界,从而最小化调度开销。
- 引入纳什社会福利目标,对作业进度失衡进行惩罚,促进保守且公平的资源分配决策。
- 通过规划未来效用变化,主动跨轮次调度作业,避免因被动重新优先级调整导致的效率损失。
实验结果
研究问题
- RQ1在机器学习作业随时间动态改变资源需求的情况下,基于市场的调度器能否维持公平性与效率?
- RQ2在动态自适应工作负载中,具有未来规划能力的主动调度与被动或静态调度相比有何差异?
- RQ3作业运行时间估计中的预测误差在多大程度上影响调度器的公平性与效率?
- RQ4与现有公平调度器(如 DRF、Themis 或 AlloX)相比,采用时变效用的动态市场模型能否实现更优的整体系统性能?
- RQ5求解器开销与实时性能如何影响此类调度器在生产集群中的实际部署?
主要发现
- 在基于 trace 的仿真中,Shockwave 相较于最先进的公平调度器(如 Themis、Gavel 和 AlloX),将完成时间缩短了 1.3 倍。
- 在动态自适应场景下,Shockwave 将公平性(以 FTF 和不公平调度作业占比衡量)提升 2 倍,优于现有调度器。
- 求解器开销极低——在 500 个作业下 15 秒超时的间隙边界仅为 0.03%,在 2000 个作业下为 0.44%,表明其具有高度可扩展性与低延迟特性。
- Shockwave 对预测误差具有强鲁棒性:即使运行时间估计存在 ±100% 的噪声,公平性也仅缓慢下降,性能仍可与基线相当。
- 调度器的主动规划显著优于被动方法,因为被动的重新优先级调整无法弥补早期效率损失。
- Shockwave 采用纳什社会福利机制,通过惩罚作业进度失衡,确保强公平性,从而实现保守且公平的调度决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。