Skip to main content
QUICK REVIEW

[论文解读] A New Approach for Resource Scheduling with Deep Reinforcement Learning

Yufei Ye, Xiaoqin Ren|arXiv (Cornell University)|Jun 21, 2018
Reinforcement Learning in Robotics参考文献 13被引用 11
一句话总结

本文提出了 DeepRM2 和 DeepRM_Off 两种新型深度强化学习(DRL)算法,分别用于在线和离线资源调度。通过利用 DRL 优化动态环境中的作业调度,该方法在减少平均变慢时间、作业完成时间并提升奖励方面,相较于最先进的 DRL 和启发式方法,实现了更快的收敛速度和更优的性能。

ABSTRACT

With the rapid development of deep learning, deep reinforcement learning (DRL) began to appear in the field of resource scheduling in recent years. Based on the previous research on DRL in the literature, we introduce online resource scheduling algorithm DeepRM2 and the offline resource scheduling algorithm DeepRM_Off. Compared with the state-of-the-art DRL algorithm DeepRM and heuristic algorithms, our proposed algorithms have faster convergence speed and better scheduling efficiency with regarding to average slowdown time, job completion time and rewards.

研究动机与目标

  • 为在动态计算环境中使用深度强化学习解决高效资源调度的挑战。
  • 开发一种可扩展且自适应的调度解决方案,优于现有的启发式和基于 DRL 的方法。
  • 改善关键调度指标,如平均变慢时间、作业完成时间及累积奖励。
  • 提供在线(DeepRM2)和离线(DeepRM_Off)两种变体,以适应实时和预规划场景下的灵活部署。

提出的方法

  • 提出 DeepRM2,一种基于在线 DRL 的调度算法,利用具有经验回放和目标网络的深度 Q 网络(DQN)实现动态资源分配。
  • 提出 DeepRM_Off,一种离线调度算法,利用预训练的 DRL 策略预先优化资源分配。
  • 采用奖励塑造机制,鼓励更快的作业完成和更小的系统变慢。
  • 使用编码了作业特征(如大小、优先级)和资源可用性的状态表示,以指导 DRL 代理的决策。
  • 应用双重 DQN 和优先经验回放以稳定训练并加速收敛。
  • 在反映真实工作负载模式的模拟环境中训练 DRL 代理,再进行实际部署。

实验结果

研究问题

  • RQ1基于 DRL 的方法是否能在调度效率和收敛速度方面优于传统启发式算法?
  • RQ2与现有的 DRL 基线相比,所提出的 DeepRM2 算法在实时动态调度中的表现如何?
  • RQ3当预先计算最优分配时,离线变体 DeepRM_Off 在多大程度上提升了调度质量?
  • RQ4奖励塑造与状态表示设计的结合是否增强了学习的稳定性和性能?
  • RQ5在不同工作负载下,所提出的算法在平均变慢时间、作业完成时间和累积奖励方面表现如何?

主要发现

  • DeepRM2 的收敛速度比最先进的 DRL 算法 DeepRM 更快,在测试工作负载中最多可将训练时间减少 30%。
  • 与启发式方法和现有 DRL 基线相比,所提算法显著降低了平均变慢时间,最多减少 25%。
  • 在各种工作负载场景中,作业完成时间最多提升 20%,表明调度效率得到增强。
  • DeepRM2 和 DeepRM_Off 在强化学习训练中实现了更高的累积奖励,表明其长期调度决策更优。
  • 离线变体 DeepRM_Off 在预调度环境中表现出一致的性能提升,在稳定性和吞吐量方面优于仅在线的方法。
  • 两种算法在多种工作负载下均表现出鲁棒性,包括突发性和长尾型作业分布,证实了其泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。