Skip to main content
QUICK REVIEW

[论文解读] Formulation and validation of a car-following model based on deep reinforcement learning

Fabian Hart, Ostap Okhrin|arXiv (Cornell University)|Sep 29, 2021
Traffic control and management参考文献 33被引用 20
一句话总结

本文提出了一种基于深度强化学习(DRL)的跟驰模型,通过可定制的奖励函数训练,以最大化安全、舒适和效率,使用截断的Ornstein-Uhlenbeck过程生成的合成前导车辆轨迹。该模型实现了无条件的车队稳定性,具备防撞行为,并在各种真实和人工前导车辆数据上优于IDM模型。

ABSTRACT

We propose and validate a novel car following model based on deep reinforcement learning. Our model is trained to maximize externally given reward functions for the free and car-following regimes rather than reproducing existing follower trajectories. The parameters of these reward functions such as desired speed, time gap, or accelerations resemble that of traditional models such as the Intelligent Driver Model (IDM) and allow for explicitly implementing different driving styles. Moreover, they partially lift the black-box nature of conventional neural network models. The model is trained on leading speed profiles governed by a truncated Ornstein-Uhlenbeck process reflecting a realistic leader's kinematics. This allows for arbitrary driving situations and an infinite supply of training data. For various parameterizations of the reward functions, and for a wide variety of artificial and real leader data, the model turned out to be unconditionally string stable, comfortable, and crash-free. String stability has been tested with a platoon of five followers following an artificial and a real leading trajectory. A cross-comparison with the IDM calibrated to the goodness-of-fit of the relative gaps showed a higher reward compared to the traditional model and a better goodness-of-fit.

研究动机与目标

  • 开发一种可在多样化交通场景(包括自由行驶和安全关键情境)中泛化的跟驰模型。
  • 克服现有DRL模型的局限性,如加速度范围受限以及在训练数据之外缺乏泛化能力。
  • 即使在极端制动场景下,也确保车队稳定性和防撞行为。
  • 通过可调节的奖励函数参数,显式建模不同的驾驶风格。
  • 在合成与真实轨迹数据(包括车队和真实世界前导-跟驰实验)上对模型进行验证。

提出的方法

  • 该模型采用模块化的DRL框架,包含两个独立策略:一个用于自由行驶,一个用于跟驰,均通过深度确定性策略梯度(DDPG)进行训练。
  • 奖励函数设计用于反映安全性(碰撞时间)、舒适性(加速度平滑性)和期望速度,参数可调以模拟不同驾驶风格。
  • 前导车辆轨迹通过截断的Ornstein-Uhlenbeck过程生成,以模拟真实的运动学特性,并实现无限且多样的训练数据。
  • 模型通过端到端训练以最大化累积奖励,策略网络将状态观测值(相对速度、车头间距、前导车速度)映射为加速度动作。
  • 通过包含五个跟驰车辆的车队仿真评估车队稳定性,使用人工和真实前导车辆轨迹。
  • 性能与校准至相同真实轨迹数据的IDM进行对比,以评估拟合优度和安全指标。

实验结果

研究问题

  • RQ1基于DRL的跟驰模型是否能在多样化且极端的交通场景(包括完全制动操作)下实现车队稳定性?
  • RQ2该模型是否能超越训练数据泛化,特别是在测试真实世界前导车辆轨迹时?
  • RQ3在相同条件下,该模型在安全性、舒适性和效率方面与传统IDM相比表现如何?
  • RQ4该模型是否能平滑地在自由行驶与跟驰模式之间切换,而不会出现行为突变?
  • RQ5通过奖励函数参数,能够多大程度上显式建模驾驶员特性(例如激进型与保守型驾驶)?

主要发现

  • 在包含人工和真实前导车辆轨迹的车队仿真中,该模型实现了无条件的车队稳定性,即使在存在大加速度异常值的情况下也表现稳定。
  • 在所有测试场景中,包括前导车辆以约6 m/s²的减速度进行极端制动时,该模型均未发生碰撞。
  • 与IDM的2.04秒相比,RL智能体实现了更低的最小碰撞时间(TTC)1.99秒,且在分布的大部分区域TTC值更高。
  • 在15次真实前导-跟驰实验中,该模型在累积奖励上平均优于IDM 1.9%,表明其在安全与舒适目标上更具对齐性。
  • 该模型在自由行驶与跟驰状态之间实现了平滑、舒适的过渡,加速度无突变。
  • 该模型在训练数据之外表现出良好的泛化能力,在训练期间未见过的真实世界轨迹上仍保持安全与稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。