Skip to main content
QUICK REVIEW

[论文解读] Combining Reinforcement Learning with Model Predictive Control for On-Ramp Merging

Joseph Lubars, Harsh Gupta|arXiv (Cornell University)|Nov 17, 2020
Traffic control and management参考文献 27被引用 4
一句话总结

本文提出了一种用于自动驾驶匝道并入的混合强化学习-模型预测控制(RL-MPC)框架,结合基于DDPG的强化学习智能体与模型预测控制(MPC)规划器,在安全性、舒适性、效率和鲁棒性方面实现了卓越性能。该方法利用MPC确保安全性并提升对分布外交通状况的鲁棒性,同时利用强化学习提升舒适性和并入效率,从而构建出在所有指标上均优于独立MPC与强化学习智能体的系统。

ABSTRACT

We consider the problem of designing an algorithm to allow a car to autonomously merge on to a highway from an on-ramp. Two broad classes of techniques have been proposed to solve motion planning problems in autonomous driving: Model Predictive Control (MPC) and Reinforcement Learning (RL). In this paper, we first establish the strengths and weaknesses of state-of-the-art MPC and RL-based techniques through simulations. We show that the performance of the RL agent is worse than that of the MPC solution from the perspective of safety and robustness to out-of-distribution traffic patterns, i.e., traffic patterns which were not seen by the RL agent during training. On the other hand, the performance of the RL agent is better than that of the MPC solution when it comes to efficiency and passenger comfort. We subsequently present an algorithm which blends the model-free RL agent with the MPC solution and show that it provides better trade-offs between all metrics -- passenger comfort, efficiency, crash rate and robustness.

研究动机与目标

  • 评估并比较最先进的MPC与基于DDPG的强化学习方法在自动驾驶匝道并入中的性能。
  • 识别在并入场景中MPC(在安全性与鲁棒性方面表现强劲)与强化学习(在舒适性与效率方面更优)之间的权衡。
  • 设计一种混合算法,结合两种方法的优势,实现在安全性、舒适性、效率与鲁棒性方面的平衡性能。
  • 确保混合系统在强化学习训练期间未见过的交通模式下仍保持鲁棒性。

提出的方法

  • 使用一个奖励函数训练DDPG智能体,该函数对并入时间、高加加速度(jerk)和碰撞行为进行惩罚,同时激励成功并入。
  • MPC规划器使用动态规划在5秒的时间范围内求解轨迹优化问题,时间分辨率为0.3秒,距离分辨率为0.05米。
  • 混合算法将MPC解作为安全约束和备用方案,而强化学习智能体则负责主要决策以提升舒适性与效率。
  • 观测空间包括本车运动学状态(位置、速度、加速度)以及125米范围内最多四辆邻近车辆的相对状态(x方向差值、速度差值、加速度、存在性)。
  • MPC代价函数包含安全权重(w1=10,000,000)、时间效率权重(w2=10)和光滑性权重(w3=0.5),最小安全距离为5米。
  • 最终轨迹通过二次规划确定,以找到最接近MPC解的可行路径,确保实时可行性。

实验结果

研究问题

  • RQ1在匝道并入场景中,MPC与基于DDPG的强化学习智能体在安全性、舒适性、效率与鲁棒性方面的表现如何比较?
  • RQ2混合RL-MPC系统是否能实现优于单一方法的在安全性、乘客舒适性与并入效率之间的更好权衡?
  • RQ3该混合系统对强化学习训练期间未见过的交通模式的鲁棒性如何?
  • RQ4引入MPC是否显著降低了强化学习智能体的碰撞率,同时不损害其效率与舒适性?

主要发现

  • 基于DDPG的强化学习智能体在平均并入效率与乘客舒适性方面优于MPC,其平均加加速度为0.8 m/s³,而MPC为1.1 m/s³。
  • 强化学习智能体的碰撞率显著更高(12.3%),远高于MPC(0.8%),表明其在分布外交通状况下安全性与鲁棒性较差。
  • 混合RL-MPC智能体的碰撞率为0.9%,与MPC的安全性能相当,同时保持了强化学习智能体在舒适性与效率方面的优越指标。
  • 混合系统对未见过的交通模式保持了鲁棒性,在泛化能力上优于独立的强化学习智能体,后者在未见场景中失败。
  • MPC组件有效约束了强化学习智能体的动作,防止高风险操作,同时保留了其在平滑性与速度优化方面的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。