[论文解读] EMVLight: A Decentralized Reinforcement Learning Framework for Efficient Passage of Emergency Vehicles
EMVLight 是一种去中心化的多智能体强化学习框架,可实时联合优化应急车辆(EMV)的动态路径规划与交通信号控制。通过扩展 Dijkstra 算法以实现自适应的路径更新,并利用专门的强化学习智能体协调信号相位,EMVLight 相较于最先进的基线方法,在合成网格和真实世界网格上分别将 EMV 行驶时间减少 18%,非 EMV 平均行驶时间减少 5%。
Emergency vehicles (EMVs) play a crucial role in responding to time-critical events such as medical emergencies and fire outbreaks in an urban area. The less time EMVs spend traveling through the traffic, the more likely it would help save people's lives and reduce property loss. To reduce the travel time of EMVs, prior work has used route optimization based on historical traffic-flow data and traffic signal pre-emption based on the optimal route. However, traffic signal pre-emption dynamically changes the traffic flow which, in turn, modifies the optimal route of an EMV. In addition, traffic signal pre-emption practices usually lead to significant disturbances in traffic flow and subsequently increase the travel time for non-EMVs. In this paper, we propose EMVLight, a decentralized reinforcement learning (RL) framework for simultaneous dynamic routing and traffic signal control. EMVLight extends Dijkstra's algorithm to efficiently update the optimal route for the EMVs in real time as it travels through the traffic network. The decentralized RL agents learn network-level cooperative traffic signal phase strategies that not only reduce EMV travel time but also reduce the average travel time of non-EMVs in the network. This benefit has been demonstrated through comprehensive experiments with synthetic and real-world maps. These experiments show that EMVLight outperforms benchmark transportation engineering techniques and existing RL-based signal control methods.
研究动机与目标
- 解决在动态交通条件下,应急车辆路径规划与自适应交通信号优先通行之间的耦合挑战。
- 在不显著增加非应急车辆平均行驶时间的前提下,降低 EMV 行驶时间,避免现有优先策略的常见缺点。
- 设计一种计算高效、实时的路径规划机制,能够在 EMV 行进过程中动态更新最优路径。
- 开发一种去中心化的多智能体强化学习框架,使路口处的智能体能够协作学习信号相位策略,以平衡 EMV 优先权与全网效率。
提出的方法
- 通过实时更新扩展 Dijkstra 算法,以在交通状况变化时持续维护 EMV 的最优路径。
- 采用去中心化的多智能体 A2C 强化学习框架,包含三种智能体类型:主优先通行智能体、次级优先通行智能体和协调智能体。
- 提出一种新颖的压力型奖励函数,鼓励在每个路口各个方向上实现车辆密度的均衡,从而提升全网效率。
- 在策略网络和价值网络中引入指纹技术,以稳定多智能体强化学习训练并加速收敛。
- 实现次级优先通行智能体,使其通过选择能够清空交通的信号相位来学习“预留”道路路段,从而保障 EMV 高速通过。
- 利用局部观测和去中心化策略,在整个网络范围内协调信号控制,避免集中式协调带来的瓶颈。
实验结果
研究问题
- RQ1去中心化的强化学习框架是否能够在时变交通环境下,同时优化 EMV 路径规划与交通信号控制?
- RQ2如何在最小化 EMV 行驶时间的同时,降低非 EMV 的平均行驶时间,避免对整体交通流产生负面影响?
- RQ3专用智能体类型(特别是次级优先通行智能体)对 EMV 通行效率与全网性能有何影响?
- RQ4奖励函数的设计,尤其是基于改进压力度量的奖励函数,如何影响多智能体信号控制中的收敛性与性能?
- RQ5在策略网络与价值网络中引入指纹技术,在多智能体强化学习训练中在多大程度上提升了训练稳定性与收敛速度?
主要发现
- 与动态路径规划基线相比,EMVLight 平均将 EMV 行驶时间减少 18%,证明了其联合路径规划与信号控制方法的有效性。
- 与表现最佳的基线方法(Max Pressure)相比,EMVLight 将非 EMV 平均行驶时间减少 5%,表明其在全网效率方面表现更优。
- 移除次级优先通行智能体后,EMV 行驶时间增加 45%,证实其在实现路段预留与保障 EMV 顺畅通行中的关键作用。
- 将压力定义替换为 PressLight 的版本后,平均行驶时间增加 13%,表明 EMVLight 改进的压力度量更有利于实现全网流量的均衡。
- 在策略网络与价值网络中引入指纹技术,显著加快了收敛速度并减少了奖励波动,验证了其在稳定多智能体强化学习训练中的作用。
- 在合成地图与真实世界地图上,EMVLight 在 EMV 行驶时间与平均车辆延迟指标上均优于传统交通工程方法与现有的基于强化学习的信号控制技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。