[论文解读] PDLight: A Deep Reinforcement Learning Traffic Light Control Algorithm with Pressure and Dynamic Light Duration
PDLight 提出了一种基于深度强化学习的交通信号控制算法,采用一种新颖的奖励函数 PRCOL(出车道剩余容量的压强),通过同时考虑进入车辆的压强和出车道容量来优化信号配时。在合成数据集和真实世界数据集上的评估表明,与当前最先进的方法(如 PressLight 和 Colight)相比,PDLight 在动态绿灯时长条件下显著降低了平均行程时间并提高了网络吞吐量。
Existing ineffective and inflexible traffic light control at urban intersections can often lead to congestion in traffic flows and cause numerous problems, such as long delay and waste of energy. How to find the optimal signal timing strategy is a significant challenge in urban traffic management. In this paper, we propose PDlight, a deep reinforcement learning (DRL) traffic light control algorithm with a novel reward as PRCOL (Pressure with Remaining Capacity of Outgoing Lane). Serving as an improvement over the pressure used in traffic control algorithms, PRCOL considers not only the number of vehicles on the incoming lane but also the remaining capacity of the outgoing lane. Simulation results using both synthetic and real-world data-sets show that the proposed PDlight yields lower average travel time compared with several state-of-the-art algorithms, PressLight and Colight, under both fixed and dynamic green light duration.
研究动机与目标
- 解决现有交通信号控制系统依赖固定或不灵活配时方案的局限性。
- 通过将车道容量引入奖励函数,改进基于强化学习的交通控制。
- 设计一种动态、自适应的信号控制算法,以有效响应实时交通变化。
- 降低车辆延误和拥堵,同时提高城市交叉口的网络吞吐量。
提出的方法
- 本文提出了 PRCOL,一种新型压强度量,结合了进入车道上的车辆数量与出车道的剩余容量。
- PDLight 在每个交叉口使用一个深度 Q 网络(DQN)智能体,基于实时交通观测学习最优信号相位动作。
- 动作空间由从每个交叉口预设的相位配置集合中选择下一个绿灯相位组成。
- 奖励函数定义为 PRCOL,其对导致出车道已满时产生车辆排队的动作施加惩罚,从而避免低效的绿灯时间使用。
- 该算法支持固定和动态绿灯时长,后者根据预测的车辆通过量进行调整。
- 在合成数据集和真实世界数据集(杭州和纽约)上进行了仿真实验,以评估不同交通条件下的性能。
实验结果
研究问题
- RQ1将出车道容量纳入奖励函数在多大程度上提升了交通信号控制的性能?
- RQ2基于 PRCOL 的奖励函数是否能相比传统基于压强的方法减少平均车辆行程时间?
- RQ3动态绿灯时长对基于强化学习的交通控制性能有何影响?
- RQ4PRCOL 在真实世界交通场景中对网络吞吐量和拥堵缓解的影响如何?
主要发现
- 根据先前研究的报告,与固定配时信号控制相比,PDLight 将平均行程时间减少了高达 73%。
- 在杭州数据集上,PDLight 在动态绿灯时长下相比 PressLight 将平均行程时间减少了 12.3%,相比 Colight 减少了 9.8%。
- 在纽约数据集上,PDLight 在动态时长下相比 Colight 将平均行程时间改善了 10.5%,相比 PressLight 改善了 14.1%。
- 该算法表现出更高的选择高流量相位的频率(杭州为 0.518,纽约为 0.549),表明其对高需求流的有效优先处理。
- 动态绿灯时长的适应性通过趋势得到验证:在高密度时段绿灯时间呈增加趋势,特别是在杭州数据集中,与实际交通需求一致。
- 随着绿灯时长增加,理想与实际通过车辆数之间的差距也增大,证实了模型对交通不确定性的合理处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。