Skip to main content
QUICK REVIEW

[论文解读] Solving the single-track train scheduling problem via Deep Reinforcement Learning

Valerio Agasucci, Giorgio Grani|arXiv (Cornell University)|Sep 1, 2020
Railway Systems and Energy Efficiency参考文献 16被引用 4
一句话总结

本文提出一种基于深度Q网络(DQN)的强化学习方法,以解决单线铁路列车调度问题,对比了去中心化(每列车独立智能体)与集中式(全局观测结合图神经网络)方法。集中式DQN在大规模、复杂实例上显著优于传统线性Q学习和混合整数规划(MILP)公式,尤其在高复杂度测试集中,平均延迟最高降低50%。

ABSTRACT

Every day, railways experience disturbances and disruptions, both on the network and the fleet side, that affect the stability of rail traffic. Induced delays propagate through the network, which leads to a mismatch in demand and offer for goods and passengers, and, in turn, to a loss in service quality. In these cases, it is the duty of human traffic controllers, the so-called dispatchers, to do their best to minimize the impact on traffic. However, dispatchers inevitably have a limited depth of perception of the knock-on effect of their decisions, particularly how they affect areas of the network that are outside their direct control. In recent years, much work in Decision Science has been devoted to developing methods to solve the problem automatically and support the dispatchers in this challenging task. This paper investigates Machine Learning-based methods for tackling this problem, proposing two different Deep Q-Learning methods(Decentralized and Centralized). Numerical results show the superiority of these techniques with respect to the classical linear Q-Learning based on matrices. Moreover, the Centralized approach is compared with a MILP formulation showing interesting results. The experiments are inspired by data provided by a U.S. Class 1 railroad.

研究动机与目标

  • 为解决网络中断情况下实时、在线的列车调度问题,其中人工调度员对连锁影响的感知能力有限。
  • 探究深度强化学习是否能在求解单线铁路调度问题时优于经典优化方法和线性Q学习方法。
  • 评估去中心化与集中式DQN方法在受美国一级铁路启发的真实、大规模铁路实例中的可扩展性与性能表现。
  • 在时间约束下,比较深度强化学习方法与标准MILP公式的解质量与计算效率。

提出的方法

  • 本文将列车调度问题建模为马尔可夫决策过程(MDP),其中动作对应于重新调度或 rerouting 决策。
  • 提出两种DQN变体:一种是去中心化方法,每列列车作为独立智能体,仅基于对附近轨道的局部观测;另一种是集中式方法,具备全局网络可见性。
  • 集中式方法采用图神经网络(GNN)编码铁路网络状态并估计Q值,从而实现在不同网络规模间的泛化能力。
  • DQN智能体通过经验回放和目标网络进行训练,以稳定学习过程,并采用稀疏的、基于延迟的奖励塑造。
  • 在五个测试集上评估该方法,测试集包含不同数量的列车和资源(轨道/车站),每组实例的时间限制为10分钟。
  • 性能通过解决实例数、平均延迟和重叠问题集上的解质量等指标与MILP公式进行基准对比。

实验结果

研究问题

  • RQ1深度Q学习是否能在求解单线铁路调度问题时优于经典线性Q学习?
  • RQ2基于GNN的状态表示,集中式DQN在解质量与可扩展性方面与MILP公式相比如何?
  • RQ3集中式DQN是否能在不重新训练的情况下有效泛化到更大规模的铁路网络?
  • RQ4在问题复杂度逐渐增加的情况下,去中心化与集中式DQN方法在性能与鲁棒性方面有何差异?
  • RQ5在大规模、复杂实例上,RL方法相较于MILP在降低平均延迟方面能达到何种程度?

主要发现

  • 在最复杂的测试集(50列列车,196项资源)中,集中式DQN将平均延迟降低了最高50%,其中MILP的平均延迟为32,504,而RL的平均延迟为16,379。
  • 在50 T 185 R测试集中,MILP的平均延迟比RL方法高出150%,表明在高复杂度下存在显著的性能差距。
  • 集中式DQN在10分钟时间限制内成功解决了50个实例中的43个,而MILP仅解决了41个,表明在时间约束下具有相当或更优的可行性。
  • 集中式方法在更大网络中表现出良好泛化能力,即使资源数从137增加到196,延迟仍保持较低水平,而MILP的平均延迟则急剧上升。
  • 去中心化DQN在小型实例上表现强劲,但在更大网络中因对全局网络状态感知有限而面临可扩展性挑战。
  • 在重叠解决的实例中,基于RL的方法始终比MILP获得更低的平均延迟,尤其在问题规模增大时优势更加明显,凸显了基于学习的全局规划方法的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。