[论文解读] Optimizing Traffic Lights with Multi-agent Deep Reinforcement Learning and V2X communication
本文提出了一种集成V2X通信的多智能体深度强化学习(DRL)框架,以优化城市交叉口的交通信号配时。通过将信号控制建模为马尔可夫决策过程,并测试四种奖励函数——两种非共享(基于等待车辆数和等待时间)和两种共享(全局指标)——该系统相比固定周期控制使平均等待车辆数减少了41.5%,其中非共享奖励优于共享奖励,因减少了智能体间的竞争。
We consider a system to optimize duration of traffic signals using multi-agent deep reinforcement learning and Vehicle-to-Everything (V2X) communication. This system aims at analyzing independent and shared rewards for multi-agents to control duration of traffic lights. A learning agent traffic light gets information along its lanes within a circular V2X coverage. The duration cycles of traffic light are modeled as Markov decision Processes. We investigate four variations of reward functions. The first two are unshared-rewards: based on waiting number, and waiting time of vehicles between two cycles of traffic light. The third and fourth functions are: shared-rewards based on waiting cars, and waiting time for all agents. Each agent has a memory for optimization through target network and prioritized experience replay. We evaluate multi-agents through the Simulation of Urban MObility (SUMO) simulator. The results prove effectiveness of the proposed system to optimize traffic signals and reduce average waiting cars to 41.5 % as compared to the traditional periodic traffic control system.
研究动机与目标
- 解决传统周期性交通信号控制中存在的低效问题,此类控制依赖有限的实时数据。
- 探索多智能体深度强化学习结合V2X通信如何改善城市交通中的动态信号配时。
- 评估不同奖励函数(个体 vs. 共享)对多智能体交通信号优化的影响。
- 在复杂、多交叉口的城市环境中,减少平均车辆等待时间与队列长度。
提出的方法
- 将交通信号控制建模为马尔可夫决策过程(MDP),包含状态、动作、奖励与转移概率。
- 采用多智能体DRL框架,其中每个交通灯作为独立智能体,在圆形覆盖半径内接收V2X数据。
- 采用双值DQN架构,结合优先经验回放与目标网络,以稳定训练并改善Q值估计。
- 设计四种不同的奖励函数:两种非共享(基于单个智能体的等待车辆数与等待时间)和两种共享(所有智能体的全局指标)。
- 在SUMO仿真器中,针对6×6交叉口场景(含2、4、8个智能体)进行训练与评估。
- 通过60个仿真周期聚合性能指标(如平均等待车辆数与奖励),以比较不同奖励函数变体。
实验结果
研究问题
- RQ1在多智能体交通信号控制中,非共享奖励设计(基于单个智能体的等待车辆数与等待时间)与共享奖励(全局指标)相比表现如何?
- RQ2V2X支持的多智能体DRL是否能比固定周期信号系统更有效地减少平均车辆等待时间与队列长度?
- RQ3智能体数量(2、4、8)如何影响基于DRL的信号控制系统性能与稳定性?
- RQ4共享奖励学习是否导致智能体间更好的协调性,还是引发更高的竞争?
- RQ5在高密度交通城市场景中,哪种奖励函数能产生最稳定且高效的信号配时策略?
主要发现
- 与传统周期性控制相比,该系统使平均等待车辆数减少了41.5%;在8智能体场景下,经过15个训练周期,峰值等待车辆数从3.9降至2.1。
- 非共享奖励函数——尤其是基于等待车辆数的奖励——优于共享奖励,实现了更低的平均等待车辆数与更稳定的训练过程。
- 采用个体奖励的智能体(如 $ r_{a_1} $)表现优于使用共享奖励的智能体(如 $ r_{a_3} $、$ r_{a_4} $),表明减少了智能体间的冲突。
- 在所有配置中,智能体10始终表现最佳,尤其在非共享奖励下,展现出更优的策略学习与适应能力。
- 共享奖励方案因目标冲突导致性能下降:某些动作虽有利于一个智能体,却损害其他智能体的奖励,从而加剧竞争。
- 在智能体数量较多(8个)时,基于等待时间的奖励($ r_{a_2} $)比基于等待车辆数的奖励更有效,表明时间指标在密集交通中更具可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。