[论文解读] Anti-Jerk On-Ramp Merging Using Deep Reinforcement Learning
本文提出一种基于深度强化学习(DRL)的方法,采用深度确定性策略梯度(DDPG)实现去中心化、高速的匝道并入,重点在于最小化车辆急动量以提升乘客舒适度,同时确保无碰撞运行。在急动量惩罚权重较小(wj = 0.00075)的情况下,与无惩罚相比,急动量降低了73%,且保持零碰撞。
Deep Reinforcement Learning (DRL) is used here for decentralized decision-making and longitudinal control for high-speed on-ramp merging. The DRL environment state includes the states of five vehicles: the merging vehicle, along with two preceding and two following vehicles when the merging vehicle is or is projected on the main road. The control action is the acceleration of the merging vehicle. Deep Deterministic Policy Gradient (DDPG) is the DRL algorithm for training to output continuous control actions. We investigated the relationship between collision avoidance for safety and jerk minimization for passenger comfort in the multi-objective reward function by obtaining the Pareto front. We found that, with a small jerk penalty in the multi-objective reward function, the vehicle jerk could be reduced by 73% compared with no jerk penalty while the collision rate was maintained at zero. Regardless of the jerk penalty, the merging vehicle exhibited decision-making strategies such as merging ahead or behind a main-road vehicle.
研究动机与目标
- 开发一种基于深度强化学习的去中心化、实时匝道并入策略,适用于高速高速公路并入场景。
- 在自动化并入过程中平衡碰撞避免(安全性)与急动量最小化(乘客舒适度)之间的竞争目标。
- 通过多目标奖励函数设计,探究安全与驾乘舒适度之间的权衡。
- 评估所得决策策略(例如,提前或滞后并入)及其对奖励设计的依赖性。
- 证明DRL可在保持零碰撞率的同时,实现接近最优的并入性能,且急动量极低。
提出的方法
- DRL环境模拟五辆车辆:并入车辆以及主路前、后各两辆车辆。
- 状态空间包括所有五辆车辆相对于并入点的相对位置、速度和距离。
- 动作空间为连续控制,表示并入车辆的加速度指令。
- 采用深度确定性策略梯度(DDPG)算法,利用深度神经网络训练连续控制策略。
- 多目标奖励函数结合了碰撞避免(碰撞时施加惩罚)、控制努力以及权重为wj的急动量惩罚项。
- 通过调节急动量惩罚权重wj,探索安全与舒适度之间的Pareto前沿,以识别最优权衡。
实验结果
研究问题
- RQ1在高速匝道并入中,碰撞避免与急动量最小化之间的最优权衡是什么?
- RQ2在奖励函数中引入急动量惩罚,如何影响并入操作的平滑性?
- RQ3在不同奖励设置下,DRL策略中涌现出的决策策略(例如,提前或滞后并入)有哪些?
- RQ4DRL策略能否在显著降低车辆急动量的同时实现零碰撞,相较于无急动量惩罚的基线方法?
- RQ5急动量惩罚的权重如何影响控制动作及整体并入性能?
主要发现
- 在急动量惩罚权重较小(wj = 0.00075)时,与无惩罚基线相比,车辆急动量降低了73%,同时保持零碰撞。
- 并入车辆表现出两种主要决策策略:在后方车辆前方并入(超过80%的时间发生),或在后方车辆后方并入。
- 优先选择前方并入,因为其急动量幅值更低,且累积折扣奖励更高,原因在于并入时间更短且停顿惩罚更少。
- 当急动量惩罚过高(wj = 0.015)时,策略未能施加足够的减速,导致因过度惩罚加速度变化而发生碰撞。
- 在无急动量惩罚(wj = 0)时,加速度与急动量曲线高度噪声,表明碰撞期间惩罚尖峰导致驾乘舒适度差且系统不稳定。
- DRL策略成功学习到保持安全距离并执行平稳并入操作,即使在密集交通场景下也无需依赖V2X通信。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。