Skip to main content
QUICK REVIEW

[论文解读] Graph neural networks-based Scheduler for Production planning problems using Reinforcement Learning

Mohammed Sharafath Abdul Hameed, Andreas Schwung|arXiv (Cornell University)|Sep 8, 2020
Scheduling and Optimization Algorithms被引用 4
一句话总结

该论文提出了一种图神经网络(GNN)增强的强化学习框架GraSP-RL,用于作业车间调度(JSSP),将生产系统建模为机器与缓冲区之间的二分图。通过使用GNN提取局部化、顺序无关的特征,并在每台机器上部署去中心化、分布式强化学习智能体,该方法在30个作业的JSSP任务中实现了更优的完工时间性能,能有效泛化至未见过的开放车间系统(OSS)和反应式JSSP(RJSSP)场景,并实现即时调度——在无需微调的情况下优于FIFO、TS和GA。

ABSTRACT

Reinforcement learning (RL) is increasingly adopted in job shop scheduling problems (JSSP). But RL for JSSP is usually done using a vectorized representation of machine features as the state space. It has three major problems: (1) the relationship between the machine units and the job sequence is not fully captured, (2) exponential increase in the size of the state space with increasing machines/jobs, and (3) the generalization of the agent to unseen scenarios. We present a novel framework - GraSP-RL, GRAph neural network-based Scheduler for Production planning problems using Reinforcement Learning. It represents JSSP as a graph and trains the RL agent using features extracted using a graph neural network (GNN). While the graph is itself in the non-euclidean space, the features extracted using the GNNs provide a rich encoding of the current production state in the euclidean space, which is then used by the RL agent to select the next job. Further, we cast the scheduling problem as a decentralized optimization problem in which the learning agent is assigned to all the production units and the agent learns asynchronously from the data collected on all the production units. The GraSP-RL is then applied to a complex injection molding production environment with 30 jobs and 4 machines. The task is to minimize the makespan of the production plan. The schedule planned by GraSP-RL is then compared and analyzed with a priority dispatch rule algorithm like first-in-first-out (FIFO) and metaheuristics like tabu search (TS) and genetic algorithm (GA). The proposed GraSP-RL outperforms the FIFO, TS, and GA for the trained task of planning 30 jobs in JSSP. We further test the generalization capability of the trained agent on two different problem classes: Open shop system (OSS) and Reactive JSSP (RJSSP) where our method produces results better than FIFO and comparable results to TS and GA.

研究动机与目标

  • 为解决现有强化学习(RL)方法在作业车间调度(JSSP)中依赖向量化状态表示所导致的可扩展性与泛化性局限。
  • 利用二分图结构建模JSSP中机器、作业与缓冲区之间的固有结构关系。
  • 通过基于本地GNN处理特征的去中心化、分布式RL学习机制,在机器层面实现独立学习,提升可扩展性与适应性。
  • 评估训练后的RL智能体在未见问题类别(如开放车间系统OSS与反应式JSSP,RJSSP)上的泛化能力。
  • 与计算密集的元启发式方法(如禁忌搜索与遗传算法)相比,实现近实时的调度决策。

提出的方法

  • 将生产环境建模为二分图,以机器与机器缓冲区为节点,捕捉作业与资源之间的相互依赖关系。
  • 在图神经网络(GNN)中应用自定义的消息传递算法,基于局部及邻近信息,从每台机器节点提取丰富、顺序无关的特征。
  • 将GNN处理后的节点特征作为输入,供给去中心化的RL智能体,该智能体在每台机器上独立运行,基于本地状态选择下一处理作业。
  • 采用端到端训练方式,使用与完工时间倒数成比例的奖励信号,并在前5000个训练周期中应用课程学习。
  • 该框架支持线性可扩展性:新增机器无需重新训练整个模型,且智能体可在不同问题配置间泛化。
  • 在包含30个作业与4台机器的真实注塑生产系统上评估该方法,并在不同作业数量与动态扰动下测试其在OSS与RJSSP中的泛化性能。

实验结果

研究问题

  • RQ1基于GNN的表示是否能比向量化状态表示更有效地捕捉RL中JSSP的结构归纳偏差?
  • RQ2基于GNN处理特征的去中心化、机器级RL是否能提升大规模JSSP中的可扩展性与泛化能力?
  • RQ3GraSP-RL智能体在完工时间与规划时间方面,相较于经典调度规则(如FIFO)与元启发式方法(如TS、GA)的表现如何?
  • RQ4训练后的RL智能体是否能在无需进一步微调的情况下泛化至未见问题类别(如OSS与RJSSP)?
  • RQ5与计算量大的元启发式方法相比,该方法是否实现了真正的实时调度性能?

主要发现

  • GraSP-RL在30个作业、4台机器的JSSP任务中,最小化完工时间方面优于FIFO、禁忌搜索(TS)与遗传算法(GA),在所有基线方法中取得最佳调度方案。
  • 该RL智能体在未见的开放车间系统(OSS)与反应式JSSP(RJSSP)中表现出有效泛化能力,无需微调,其结果优于FIFO,且与TS和GA相当。
  • 在所有测试的OSS与RJSSP场景中,智能体的平均完工时间与最佳元启发式方法相差不足1%,标准差低于0.01。
  • 智能体可实现即时调度——比TS与GA快100倍,如表3所示,后者每份计划需约100倍更长时间。
  • 基于GNN的方法显著优于使用多层感知机(MLP)的非图基线,证明了图结构在建模JSSP中的关键作用。
  • 该框架在不同作业数量(14至24个)与机器数量(最多8台)下均保持性能稳定,证实了其鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。