[论文解读] Low-latency job scheduling with preemption for the development of deep learning
该论文提出 FitGpp,一种低延迟作业调度算法,通过根据资源需求和可恢复性选择性地抢占最佳努力(BE)作业,从而减少深度学习工作负载中的试错(TE)作业延迟。与 FIFO 相比,该算法将 TE 作业的第 95 百分位数延迟降低了 96.6%,同时将 BE 作业的延迟增加控制在中位数 18.0% 和第 95 百分位数 23.9% 以内。
One significant challenge in the job scheduling of computing clusters for the development of deep learning algorithms is the efficient scheduling of trial-and-error (TE) job, the type of job in which the users seek to conduct small-scale experiments while monitoring their processes. Unfortunately, the existing job schedulers to date do not feature well-balanced scheduling for the mixture of TE jobs and best-effort (BE) jobs, or they can handle the mixture in limited situations at most. To fill in this niche, we propose an algorithm that can significantly reduce the latency of TE jobs in versatile situations without greatly elongating the slowdown of the BE jobs. Our algorithm efficiently schedules both TE and BE jobs by selectively preempting the BE jobs that can be, when the time comes, resumed without much delay. In our simulation study with synthetic and real workloads, we were able to reduce the 95th percentile of the slowdown rates for the TE jobs in the standard FIFO strategy by 96.6%, while compromising the median of the BE slowdown rates by only 18.0% and the 95th percentile by only 23.9%.
研究动机与目标
- 解决深度学习集群中低延迟试错(TE)作业与高吞吐量最佳努力(BE)作业之间调度不平衡的问题。
- 在不显著增加 BE 作业延迟的情况下减少 TE 作业延迟,尤其是在混合工作负载中。
- 设计一种抢占策略,通过限制抢占频率并选择可恢复作业,避免 BE 作业饥饿。
- 实现对包括使用 all-reduce 架构在内的多种深度学习框架的高效调度。
- 提供一种适用于现实世界集群工作负载和动态资源需求的实用、可投入生产的解决方案。
提出的方法
- FitGpp 算法基于资源消耗和快速恢复的可能性,使用评分函数选择 BE 作业进行抢占,优先选择资源消耗较低且可恢复性较高的作业。
- 它动态暂停选定的 BE 作业,从而释放 GPU 资源,以便立即分配给待处理的 TE 作业。
- 该算法对每个 BE 作业设置最大抢占次数上限,以防止饥饿并确保公平性。
- 它使用参数 's' 控制抢占的激进程度,平衡 TE 作业的响应速度与 BE 作业的延迟。
- 调度器无需执行时间估计,因此对深度学习作业中常见的超参数敏感性具有鲁棒性。
- 它支持合成工作负载和真实工作负载,包括来自大学集群的 trace 数据,并与多种深度学习框架兼容。
实验结果
研究问题
- RQ1基于抢占的调度器是否能在混合深度学习工作负载中显著降低 TE 作业延迟,同时避免对 BE 作业造成过度延迟?
- RQ2抢占阈值参数 's' 的选择如何影响 TE 作业响应速度与 BE 作业性能之间的权衡?
- RQ3当工作负载包含具有可变执行模式的长周期 BE 作业时,抢占能在多大程度上减少 TE 作业延迟?
- RQ4该算法在不同工作负载比例和 GP 长度分布下,是否能保持较低的 BE 作业延迟?
- RQ5在真实集群 trace 数据中,该算法是否能优于非抢占的 FIFO 以及其他抢占策略(如 LRTP 和 RAND)?
主要发现
- 当 s=4.0 时,FitGpp 将 TE 作业第 95 百分位数延迟降低了 96.6%,相比 FIFO 的 2080 降低至 9.00。
- 与 FIFO 相比,FitGpp 将 BE 作业的中位数延迟降低了 29.6%,从 16.2 降至 11.4。
- 使用 FitGpp 时,BE 作业第 95 百分位数延迟仅增加 18.0%(从 443 降至 372),而中位数延迟则减少了 16.0%。
- FitGpp 在不同 TE 作业比例下均保持了较低的 BE 作业延迟,无论工作负载组合如何,其表现始终优于其他算法。
- 该算法对 GP 长度分布变化具有鲁棒性,当 s=8.0 时,能有效缓解长 GP 条件下 TE 作业延迟的增加。
- 在真实集群 trace 评估中,FitGpp 的 BE 作业第 95 百分位数延迟比 FIFO 低 16.0%,同时将 TE 作业第 95 百分位数延迟降低至仅 9.00。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。