[论文解读] RLScheduler: An Automated HPC Batch Job Scheduler Using Reinforcement Learning
RLScheduler 是一种基于强化学习的 HPC 批处理作业调度器,通过试错自动学习高质量的调度策略,几乎无需专家干预。它在多种工作负载和优化目标下均优于传统调度器,并通过基于核函数的神经网络和轨迹过滤技术,实现了对未见过的工作负载的稳定性能与良好泛化能力。
Today high-performance computing (HPC) platforms are still dominated by batch jobs. Accordingly, effective batch job scheduling is crucial to obtain high system efficiency. Existing HPC batch job schedulers typically leverage heuristic priority functions to prioritize and schedule jobs. But, once configured and deployed by the experts, such priority functions can hardly adapt to the changes of job loads, optimization goals, or system settings, potentially leading to degraded system efficiency when changes occur. To address this fundamental issue, we present RLScheduler, an automated HPC batch job scheduler built on reinforcement learning. RLScheduler relies on minimal manual interventions or expert knowledge, but can learn high-quality scheduling policies via its own continuous 'trial and error'. We introduce a new kernel-based neural network structure and trajectory filtering mechanism in RLScheduler to improve and stabilize the learning process. Through extensive evaluations, we confirm that RLScheduler can learn high-quality scheduling policies towards various workloads and various optimization goals with relatively low computation cost. Moreover, we show that the learned models perform stably even when applied to unseen workloads, making them practical for production use.
研究动机与目标
- 解决传统 HPC 调度器因依赖固定且手动调优的优先级函数而造成的僵化问题。
- 实现自动化、自适应的作业调度,能够动态响应工作负载和优化目标的变化。
- 评估强化学习是否能够在无需专家干预的情况下学习到稳定且高性能的调度策略。
- 识别影响基于强化学习的调度器性能的关键因素,并提出提升学习效率与鲁棒性的解决方案。
提出的方法
- RLScheduler 采用深度 Q 网络(DQN)智能体,通过强化学习根据作业属性(如提交时间、请求处理器数和运行时间)分配作业优先级。
- 引入基于核函数的深度神经网络,以提升策略表示能力,并增强在多样化作业工作负载下的泛化能力。
- 采用轨迹过滤机制,降低训练数据中的噪声和方差,从而稳定学习过程。
- 基于系统级指标(如作业吞吐量、等待时间与资源利用率)使用稀疏奖励进行训练。
- 在合成与真实世界作业轨迹上进行训练,并在未见过的工作负载上进行评估,以检验泛化能力。
- 在启用与禁用回填(backfilling)的条件下评估系统,以评估其在不同部署场景下的鲁棒性。
实验结果
研究问题
- RQ1强化学习能否在各种工作负载和优化目标下学习到与最先进启发式调度器相当或更优的调度策略?
- RQ2所学习的强化学习策略是否能有效泛化到训练过程中未见过的作业工作负载?
- RQ3影响基于强化学习的 HPC 调度器学习效率与性能稳定性的关键因素是什么?
- RQ4神经网络架构与训练数据方差如何影响所学调度策略的可扩展性与鲁棒性?
主要发现
- RLScheduler 在多个真实与合成工作负载上,其调度性能与最先进调度器(如 FCFS、SJF、WFP3 和 UNICEP)相当或更优。
- 在 Lublin-1 轨迹(启用回填)上,RLScheduler 将平均作业等待时间降低至 12,460 秒,优于 FCFS(24,887 秒)及其他调度器。
- 在 HPC2N 上(未启用回填),RLScheduler 的作业延迟(slowdown)为 270.7,显著优于 FCFS(13,938)和 UNICEP(29,633)。
- 该模型对未见过的工作负载泛化良好,即使在仅用一个轨迹训练并在另一轨迹上测试时,仍保持稳定性能,展现出强大的泛化能力。
- 基于核函数的神经网络与轨迹过滤机制显著提升了训练稳定性与收敛速度,降低了策略学习中的方差。
- RLScheduler 在训练期间计算成本较低,并在吞吐量、等待时间与延迟等多样化指标上均保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。