Skip to main content
QUICK REVIEW

[论文解读] Learning to Dispatch for Job Shop Scheduling via Deep Reinforcement Learning

Cong Zhang, Wen Song|arXiv (Cornell University)|Oct 23, 2020
Scheduling and Optimization Algorithms参考文献 49被引用 236
一句话总结

本文提出一种尺寸无关的、基于图神经网络的深度强化学习方法,自动学习用于求解作业车间调度问题的高质量优先派工规则(PDR),在传统PDR基线上表现更好,并能推广到更大的实例。

ABSTRACT

Priority dispatching rule (PDR) is widely used for solving real-world Job-shop scheduling problem (JSSP). However, the design of effective PDRs is a tedious task, requiring a myriad of specialized knowledge and often delivering limited performance. In this paper, we propose to automatically learn PDRs via an end-to-end deep reinforcement learning agent. We exploit the disjunctive graph representation of JSSP, and propose a Graph Neural Network based scheme to embed the states encountered during solving. The resulting policy network is size-agnostic, effectively enabling generalization on large-scale instances. Experiments show that the agent can learn high-quality PDRs from scratch with elementary raw features, and demonstrates strong performance against the best existing PDRs. The learned policies also perform well on much larger instances that are unseen in training.

研究动机与目标

  • 自动化设计有效的优先派工规则(PDRs)用于 JSSP 的深度强化学习。
  • 利用不相容图表示捕捉调度决策的依赖关系和机器状态。
  • 开发尺寸无关、可泛化的策略,能够扩展到不同数量的作业和机器。
  • 证明学习的 PDR 相较于手工设计的规则在生成和公开基准上具有更好表现。

提出的方法

  • 将 JSSP 派工形式化为马尔可夫决策过程,其中状态为不相容图,行动为调度符合条件的操作。
  • 使用图同构网络(GIN)嵌入图结构状态,获得固定维度的节点和图嵌入。
  • 采用加弧策略生成稀疏有向不相容图,供 GNN 处理,并通过多层感知机(MLP)推导行动分数。
  • 使用基于 GNN 的网络参数化策略,并采用带有共享 GNN 骨干的评论者(critic)进行 PPO 训练。
  • 将奖励定义为 makespan 下界的改进,鼓励能降低预计 makespan 的行动;对累计奖励使用 gamma=1。
  • 在 Taillard 风格的生成实例和公开基准(Taillard 和 DMU)上评价,并与传统 PDR(如 SPT、MWKR、MOPNR、FDD/MWKR)等进行比较。

实验结果

研究问题

  • RQ1DRL 框架能否从头开始使用原始特征为 JSSP 学习高质量、可泛化的 PDR?
  • RQ2一个在小实例上训练的尺寸无关的基于 GNN 的策略,是否能泛化到更大、未见过的问题规模?
  • RQ3学习的 PDR 相对于标准基准上的传统手工设计 PDR 的表现如何?
  • RQ4不相容图表示和基于图的嵌入能否有效捕捉调度动态以指引决策?

主要发现

  • 学习的 PDRs 在生成的不同大小实例上持续优于传统基线(SPT、MWKR、FDD/MWKR、MOPNR)。
  • 学习的策略能泛化到培训时未见过的显著更大实例(如 50×20 与 100×20),性能优于传统 PDR。
  • 使用 PPO 与基于 GIN 的策略训练得到的尺寸无关策略,可扩展到任意实例大小,无需针对每个大小重新训练。
  • 推断时间比经典 PDR 更长,但在实际时间限制内提供了显著的 makespan 改进,并在许多大规模实例上超越 OR-Tools。
  • 在 Taillard 与 DMU 基准上的实验表明,学习的 PDR 维持较强表现且与最佳已知解的差距优于基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。