[论文解读] A Traffic Light Dynamic Control Algorithm with Deep Reinforcement Learning Based on GNN Prediction
本文提出 GPlight,一种结合图神经网络(GNN)交通流预测与动态交通信号控制的深度强化学习算法,旨在减少多交叉口城市路网中的拥堵。通过预测短期交通状况,并结合预测结果与实时数据来优化绿灯相位与时长,GPlight 在杭州和纽约的真实与合成数据集上均验证了其在提升网络吞吐量和降低延迟方面的有效性。
Today's intelligent traffic light control system is based on the current road traffic conditions for traffic regulation. However, these approaches cannot exploit the future traffic information in advance. In this paper, we propose GPlight, a deep reinforcement learning (DRL) algorithm integrated with graph neural network (GNN) , to relieve the traffic congestion for multi-intersection intelligent traffic control system. In GPlight, the graph neural network (GNN) is first used to predict the future short-term traffic flow at the intersections. Then, the results of traffic flow prediction are used in traffic light control, and the agent combines the predicted results with the observed current traffic conditions to dynamically control the phase and duration of the traffic lights at the intersection. Experiments on both synthetic and two real-world data-sets of Hangzhou and New-York verify the effectiveness and rationality of the GPlight algorithm.
研究动机与目标
- 解决传统交通信号控制方法仅依赖当前交通状态、忽略未来拥堵风险的局限性。
- 通过预测性控制主动缓解未来拥堵,提升城市交通效率。
- 整合图神经网络(GNN)以建模复杂的路网结构,并预测短期交通流。
- 开发一种结合实时观测与预测交通信息的动态交通灯控制策略,以优化绿灯相位与时长。
- 在杭州和纽约的合成及真实世界交通数据集上验证所提方法的有效性。
提出的方法
- 使用图神经网络(GNN)建模路网中的空间与结构关系,捕捉交叉口之间的交通流模式。
- 基于历史交通数据训练 GNN,以预测各交叉口未来的短期交通流量。
- 将预测的交通流与实时交通观测数据结合,形成强化学习的综合状态表示。
- 应用深度 Q 网络(DQN)强化学习算法,根据组合状态动态选择最优交通灯相位与时长。
- 设计奖励函数,以鼓励减少车辆延迟并提升网络吞吐量。
- 根据预测的车辆数量优化绿灯时长,优先保障预期交通量较高的方向,防止积压。
实验结果
研究问题
- RQ1与仅依赖当前状态的反应式方法相比,将未来交通流预测整合到交通信号控制中是否能显著提升城市交通效率?
- RQ2基于 GNN 的方法在捕捉城市交通路网中短期的时空依赖关系方面效果如何?
- RQ3结合预测与实时交通数据在多交叉口交通控制中,对深度强化学习性能的提升程度如何?
- RQ4在真实世界交通数据上,所提出的 GPlight 算法与基线方法相比,在吞吐量提升与延迟降低方面表现如何?
- RQ5预测延迟对控制性能有何影响?历史数据在缓解此类延迟方面能发挥多大作用?
主要发现
- 与仅依赖当前交通状态的基线强化学习方法相比,GPlight 显著提升了网络吞吐量并减少了平均车辆延迟。
- 基于 GNN 的交通流预测模型能够捕捉未来交通流的总体趋势,对突发交通激增的响应虽存在明显但可接受的延迟——例如,在人工注入流量后预测延迟约 200 秒。
- 该算法能动态延长重车流入方向的绿灯时长(如杭州的 'WE' 方向与纽约的 'NS' 方向),该策略与吞吐量提升和积压减少密切相关。
- 在重车到达前,GPlight 优先为较不拥堵的方向分配绿灯时间,以清空现有车辆,避免无谓等待,从而减少性能差距。
- 模型的预测精度随历史数据增加而提升;使用前一日或前一周的历史数据可减少预测延迟,提升对交通高峰的响应能力。
- 在合成数据集及真实世界数据集(杭州与纽约)上的实验结果证实,该算法在不同城市交通模式下均具备鲁棒性与良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。