[论文解读] Hybrid intelligence for dynamic job-shop scheduling with deep reinforcement learning and attention mechanism
本论文提出了一种用于动态作业车间调度(DJSP)的混合强化学习框架,将调度状态建模为显性图,并利用注意力机制进行图表示学习。该框架采用一种新型的D3QPN智能体,结合了双深度Q网络、优先经验回放和噪声网络,以选择最优调度规则,在所有基准实例中均实现了比最先进(SOTA)方法更低的完工时间(makespan),并引入了一个新的公开Gymjsp基准以实现可复现性和标准化。
The dynamic job-shop scheduling problem (DJSP) is a class of scheduling tasks that specifically consider the inherent uncertainties such as changing order requirements and possible machine breakdown in realistic smart manufacturing settings. Since traditional methods cannot dynamically generate effective scheduling strategies in face of the disturbance of environments, we formulate the DJSP as a Markov decision process (MDP) to be tackled by reinforcement learning (RL). For this purpose, we propose a flexible hybrid framework that takes disjunctive graphs as states and a set of general dispatching rules as the action space with minimum prior domain knowledge. The attention mechanism is used as the graph representation learning (GRL) module for the feature extraction of states, and the double dueling deep Q-network with prioritized replay and noisy networks (D3QPN) is employed to map each state to the most appropriate dispatching rule. Furthermore, we present Gymjsp, a public benchmark based on the well-known OR-Library, to provide a standardized off-the-shelf facility for RL and DJSP research communities. Comprehensive experiments on various DJSP instances confirm that our proposed framework is superior to baseline algorithms with smaller makespan across all instances and provide empirical justification for the validity of the various components in the hybrid framework.
研究动机与目标
- 通过实现自适应、数据驱动的调度决策,解决传统调度规则在动态、不确定制造环境中的局限性。
- 克服元启发式和数学规划方法在动态调度场景中泛化能力差和可扩展性不足的问题。
- 开发一种灵活、知识增强的强化学习框架,将领域特定的调度规则与深度学习相结合,以提升决策能力。
- 提供一个基于OR-Library的标准化、开源基准(Gymjsp),以支持RL-based DJSP算法的可复现和可比较评估。
- 通过消融研究和在多样化DJSP实例上的实证验证,证明D3QPN架构中关键组件的有效性。
提出的方法
- 将动态作业车间调度问题(DJSP)建模为马尔可夫决策过程(MDP),以显性图为状态表示,以一组通用调度规则作为动作空间。
- 采用带有注意力机制的图神经网络作为图表示学习(GRL)模块,从显性图状态中提取有意义且上下文感知的特征。
- 设计一种新型D3QPN智能体——结合双Q学习、双深度网络、优先经验回放和噪声网络,以在稀疏奖励环境中稳定训练并提升策略学习效果。
- 使用基于机器利用率和完工时间最小化的奖励函数,引导智能体做出高效调度决策。
- 将D3QPN智能体与GRL模块集成,实现实时将每个状态(显性图)映射到最合适的调度规则。
- 开发并发布Gymjsp,一个基于OR-Library的公开、标准化强化学习环境,以支持DJSP算法的可复现基准测试。
实验结果
研究问题
- RQ1结合领域知识(调度规则)与深度强化学习的混合智能框架,是否能在动态作业车间调度中实现优于基于规则和元启发式方法的性能?
- RQ2注意力机制在捕捉显性图表示中的结构和时序依赖关系方面,对调度状态编码的有效性如何?
- RQ3与标准DQN和Rainbow基线相比,D3QPN架构中的各组件(双深度、优先经验回放、噪声网络)在DJSP中对性能提升的贡献程度如何?
- RQ4标准化的开源基准(Gymjsp)是否能够实现跨多样化问题实例的公平且可复现的RL-based DJSP算法评估?
- RQ5所提出的框架在具有不同复杂度和动态特性的多种DJSP实例上是否具备良好的泛化能力?
主要发现
- 在Gymjsp环境中的全部10个基准实例上,所提出的基于D3QPN的框架相较于最强基线(DQN)实现了平均10%的完工时间降低。
- 在la01实例上,完工时间从基线DQN的1600降低至1399,实现了12.5%的改进;在yn1实例上,相比次优方法实现了7%的减少。
- 消融研究证实,D3QPN的每个组件(双深度、噪声网络、优先经验回放)均对性能有正向贡献,而分布式和多步DQN变体因在低动作空间设置下产生干扰,导致性能下降。
- D3QPN智能体在训练过程中实现了最高且最稳定的累积奖励,如学习曲线所示,表明其策略收敛具有鲁棒性。
- 该框架不仅优于DQN和Rainbow,还在所有测试实例中优于其他SOTA强化学习方法(如PPO和DDPG),在完工时间最小化方面表现更优。
- 开源的Gymjsp基准支持标准化、可复现的评估,并已随完整代码和数据发布,供社区使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。