[论文解读] V2I Connectivity-Based Dynamic Queue-Jump Lane for Emergency Vehicles: A Deep Reinforcement Learning Approach
本文提出了一种基于深度强化学习(DRL)的动态排队跃迁车道(DQJL)系统,利用车与基础设施(V2I)通信技术,以减少应急车辆(EMVs)的响应时间。通过使用马尔可夫决策过程建模驾驶员反应的不确定性,并训练DRL智能体实时发出协调指令,该系统在中等拥堵条件下实现了14.89%的平均EMV通过时间减少,优于SUMO微观仿真中的基准策略。
Emergency vehicle (EMV) service is a key function of cities and is exceedingly challenging due to urban traffic congestion. A main reason behind EMV service delay is the lack of communication and cooperation between vehicles blocking EMVs. In this paper, we study the improvement of EMV service under V2I connectivity. We consider the establishment of dynamic queue jump lanes (DQJLs) based on real-time coordination of connected vehicles. We develop a novel Markov decision process formulation for the DQJL problem, which explicitly accounts for the uncertainty of drivers' reaction to approaching EMVs. We propose a deep neural network-based reinforcement learning algorithm that efficiently computes the optimal coordination instructions. We also validate our approach on a micro-simulation testbed using Simulation of Urban Mobility (SUMO). Validation results show that with our proposed methodology, the centralized control system saves approximately 15\% EMV passing time than the benchmark system.
研究动机与目标
- 解决由于城市拥堵和缺乏车辆协调导致的EMV响应时间延迟日益加剧的问题。
- 开发一种动态排队跃迁车道(DQJL)策略,使EMV能够通过实时V2I通信和联网车辆协作来绕过交通拥堵。
- 在真实交通环境中,对EMV接近时驾驶员反应的随机性进行建模与考量。
- 设计并验证一种深度强化学习框架,以计算针对非EMV的最优、安全且可解释的协调指令。
- 使用SUMO微观仿真测试平台,在不同交通密度和速度条件下评估系统性能与基准策略的对比。
提出的方法
- 将DQJL问题建模为一个马尔可夫决策过程(MDP),明确刻画驾驶员对接近EMV反应的不确定性。
- 设计一种基于深度Q网络(DQN)的强化学习算法,并采用自定义奖励函数,以优化非EMV的协调策略。
- 通过蜂窝网络实现实时V2I通信,广播EMV路径信息,并协调车辆速度调整,以形成临时的DQJL。
- 在SUMO中实现仿真框架,采用真实的跟车模型和随机初始车辆位置,以测试系统的鲁棒性。
- 使用经验回放和目标网络训练DRL智能体,以在随机交通环境中稳定学习并提高收敛性。
- 基于车辆位置、速度和EMV接近程度定义状态空间,动作空间则为非EMV安全让行所需的速度调整指令。
实验结果
研究问题
- RQ1如何实时协调V2I联网车辆,以形成应急车辆的动态排队跃迁车道?
- RQ2驾驶员反应不确定性对DQJL协调策略有效性有何影响?
- RQ3在随机交通条件下,DRL智能体能否学会发出安全、有效且可解释的协调指令?
- RQ4与基准协调策略相比,基于DRL的DQJL系统在EMV通过时间方面的性能表现如何?
- RQ5在何种交通条件(如密度、速度)下,基于DRL的DQJL策略最为有效?
主要发现
- 在中等拥堵条件下(车辆间距12m/veh,背景速度5m/s),与基准系统相比,基于DRL的协调系统将平均EMV通过时间减少了14.89%。
- 性能提升最大出现在中等交通密度下,此时DQJL系统每100米城市道路可节省约2.5秒时间。
- 所有仿真运行中系统均实现了绝对安全,DQJL形成过程中未发生任何碰撞或不安全操作。
- 当交通既不太稀疏也不太密集时,性能增益最为显著,表明DRL策略存在一个最优工作窗口。
- 较高的背景交通速度可减少EMV的时间损失,而DRL系统通过加快DQJL形成速度,在此类条件下最大化了效益。
- DRL智能体在多种初始条件下均表现出良好的泛化能力,证明了其对随机车辆分布和动态交通状态的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。