Skip to main content
QUICK REVIEW

[论文解读] Expression might be enough: representing pressure and demand for reinforcement learning based traffic signal control

Liang Zhang, Qiang Wu|arXiv (Cornell University)|Dec 19, 2021
Traffic control and management被引用 12
一句话总结

本文提出 Advanced-MP,一种新颖的交通信号控制方法,通过整合排队车辆与行驶车辆信息,改进基于压力的状态表征。通过将此先进的交通状态(ATS)与基于强化学习的 Advanced-XLight 模板结合,作者在大规模城市网络中实现了最先进性能,在多个真实世界数据集上均显著降低了平均行程时间。

ABSTRACT

Many studies confirmed that a proper traffic state representation is more important than complex algorithms for the classical traffic signal control (TSC) problem. In this paper, we (1) present a novel, flexible and efficient method, namely advanced max pressure (Advanced-MP), taking both running and queuing vehicles into consideration to decide whether to change current signal phase; (2) inventively design the traffic movement representation with the efficient pressure and effective running vehicles from Advanced-MP, namely advanced traffic state (ATS); and (3) develop a reinforcement learning (RL) based algorithm template, called Advanced-XLight, by combining ATS with the latest RL approaches, and generate two RL algorithms, namely "Advanced-MPLight" and "Advanced-CoLight" from Advanced-XLight. Comprehensive experiments on multiple real-world datasets show that: (1) the Advanced-MP outperforms baseline methods, and it is also efficient and reliable for deployment; and (2) Advanced-MPLight and Advanced-CoLight can achieve the state-of-the-art.

研究动机与目标

  • 为解决现有交通状态表征忽略行驶车辆且在相位切换方面缺乏灵活性的局限性。
  • 开发一种更具表现力且高效的交通状态表征,以同时捕捉排队压力与行驶车辆的交通需求。
  • 设计一种灵活、可扩展的基于强化学习的框架,整合先进状态表征以实现大规模交通信号控制。
  • 在多样化城市交通网络中展示所提方法的优越性能与泛化能力。

提出的方法

  • 提出 Advanced-MP,一种灵活的相位切换策略,通过评估排队车辆与行驶车辆来确定最优信号相位切换。
  • 通过结合特定观测范围内的交通流压力与有效行驶车辆数量,构建先进的交通状态(ATS)。
  • 提出 Advanced-XLight 模板,一种将 ATS 与任意深度强化学习方法集成的强化学习算法框架,支持新算法的模块化开发。
  • 采用动态观测范围处理行驶车辆,仅考虑在定义的有效范围(如 100m 或 200m)内的车辆,以避免噪声并提升效率。
  • 采用基于压力与需求信号增强的贪婪动作选择机制,提升响应速度并减少不必要的相位切换。
  • 将 Advanced-XLight 模板应用于生成两种具体算法:Advanced-MPLight 与 Advanced-CoLight,二者均基于深度 Q 网络进行训练,并采用集中式训练与分布式执行策略。

实验结果

研究问题

  • RQ1一种同时包含排队压力与行驶车辆需求的交通状态表征是否能显著提升信号控制性能?
  • RQ2在状态表征中引入有效行驶车辆对基于强化学习的交通信号控制器的泛化性与鲁棒性有何影响?
  • RQ3Advanced-MP 方法在效率与适应性方面是否优于现有的最大压力控制与感应控制策略,且在多样化交通条件下表现更优?
  • RQ4Advanced-XLight 框架在多大程度上实现了大规模城市交通网络中的可迁移性与可扩展性?

主要发现

  • Advanced-MP 在所有测试的动作持续时间下均优于先前的最先进方法,包括 Efficient-CoLight,展现出更优的性能与鲁棒性。
  • Advanced-MPLight 与 Advanced-CoLight 在所有评估的真实世界数据集上均实现了最佳的平均行程时间减少效果,证实了 ATS 表征的有效性。
  • 当使用行驶车辆的有效观测范围(如 100m 或 200m)时,模型性能达到最大值;而将所有行驶车辆纳入观测范围则会降低性能,表明有效范围的选择至关重要。
  • Advanced-MPLight 展现出强大的可迁移性,在从济南与杭州数据集迁移至纽约市数据集时,性能优于直接训练所得结果,表明其过拟合程度低且泛化能力高。
  • 所提出的 ATS 表征比仅基于压力或简单排队的表征更能捕捉有意义的交通动态,从而实现更高效、更灵敏的信号控制。
  • 全面的消融实验验证了引入行驶车辆需求可显著提升模型性能,证实了本方法核心设计原则的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。