[论文解读] Dynamic Queue-Jump Lane for Emergency Vehicles under Partially Connected Settings: A Multi-Agent Deep Reinforcement Learning Approach
本文提出了一种在部分连接的V2X环境下的应急车辆动态排队跃迁车道(DQJL)系统,采用多智能体深度强化学习方法。通过实时、自适应地协调联网车辆让行,该方法在城市道路中将应急车辆通过时间减少高达30%,即使在联网车辆渗透率变化及驾驶员行为具有随机性的情况下依然有效。
Emergency vehicle (EMV) service is a key function of cities and is exceedingly challenging due to urban traffic congestion. The main reason behind EMV service delay is the lack of communication and cooperation between vehicles blocking EMVs. In this paper, we study the improvement of EMV service under V2X connectivity. We consider the establishment of dynamic queue jump lanes (DQJLs) based on real-time coordination of connected vehicles in the presence of non-connected human-driven vehicles. We develop a novel Markov decision process formulation for the DQJL coordination strategies, which explicitly accounts for the uncertainty of drivers' yielding pattern to approaching EMVs. Based on pairs of neural networks representing actors and critics for agent vehicles, we develop a multi-agent actor-critic deep reinforcement learning algorithm that handles a varying number of vehicles and a random proportion of connected vehicles in the traffic. Approaching the optimal coordination strategies via indirect and direct reinforcement learning, we present two schemata to address multi-agent reinforcement learning on this connected vehicle application. Both approaches are validated, on a micro-simulation testbed SUMO, to establish a DQJL fast and safely. Validation results reveal that, with DQJL coordination strategies, it saves up to 30% time for EMVs to pass a link-level intelligent urban roadway than the baseline scenario.
研究动机与目标
- 解决由于城市交通拥堵和缺乏车辆协调导致的应急车辆响应时间增加的问题。
- 为混合交通(包含联网车辆与人工驾驶车辆)中的动态排队跃迁车道(DQJL)开发一种可扩展、实时的协调策略。
- 克服驾驶员让行行为的不确定性以及应急车辆通行时车道变道空间有限的问题。
- 在部分连接条件下,利用多智能体强化学习实现DQJL形成的实时、去中心化决策。
- 与无协调的基线场景相比,验证DQJL协调在减少应急车辆在路段级城市道路通行时间方面的有效性。
提出的方法
- 将DQJL协调问题建模为部分可观察马尔可夫决策过程(POMDP),以模拟驾驶员配合度和交通状况的不确定性。
- 开发一种基于集中训练、去中心化执行(CTDE)的多智能体演员-critic深度强化学习算法,以实现对不同车辆数量和连接率的可扩展性。
- 实施两种方法:一种是使用改进的跟驰模型并引入随机行为的间接方法,另一种是基于SUMO交通仿真的端到端训练的直接方法。
- 采用双延迟深度确定性策略梯度(TD3)算法,并在各智能体之间共享策略网络,以处理连续动作空间(例如车道变更决策)。
- 集成V2X通信以向联网车辆广播DQJL形成指令,实现实时协调,而无需完全的车辆连接。
- 在SUMO中生成的合成微观仿真数据集上训练该框架,包含动态应急车辆路径规划和变化的联网车辆渗透率。
实验结果
研究问题
- RQ1在具有随机驾驶员行为的部分连接城市交通环境中,如何有效协调动态排队跃迁车道?
- RQ2联网车辆渗透率的变化对DQJL协调策略的性能和可扩展性有何影响?
- RQ3多智能体深度强化学习是否能在动态交通条件下实现实时、安全且高效的DQJL形成?
- RQ4在DQJL应用中,间接与直接多智能体强化学习方法在训练效率和协调有效性方面有何差异?
- RQ5与无任何协调的基线场景相比,DQJL协调在多大程度上能减少应急车辆通过时间?
主要发现
- 所提出的DQJL协调系统相较于无协调的基线场景,可将城市道路路段上的应急车辆通过时间减少高达30%。
- 直接多智能体强化学习方法在协调性能上表现更优,但其训练时间约为间接方法的四倍。
- 训练后策略的平均决策时间为5.3ms,符合3GPP V2X通信标准中≤10ms消息间隔的要求。
- 训练时间随非应急车辆数量的增加呈指数级增长,表明受维度灾难的影响日益显著。
- 即使在低联网车辆渗透率下,该框架依然有效,表明其在部分连接环境中的鲁棒性。
- 间接与直接两种方法相较于基线均表现出显著的性能提升,证实了在真实城市交通场景中协调DQJL形成的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。