Skip to main content
QUICK REVIEW

[论文解读] Automated Lane Change Decision Making using Deep Reinforcement Learning in Dynamic and Uncertain Highway Environment

Ali Alizadeh, Majid Moghadam|arXiv (Cornell University)|Sep 18, 2019
Autonomous Vehicle Technology and Safety参考文献 19被引用 5
一句话总结

本文提出一种深度强化学习(DRL)智能体,用于在动态、不确定的高速公路环境中实现自动变道,该智能体在包含噪声传感器数据和自适应车辆动力学的逼真仿真环境中进行训练。与基于规则的MOBIL算法相比,该DRL智能体在不确定环境下展现出更高的安全性和鲁棒性,在MOBIL失败的噪声场景中实现了零碰撞,证明了其更强的适应能力与实际应用潜力。

ABSTRACT

Autonomous lane changing is a critical feature for advanced autonomous driving systems, that involves several challenges such as uncertainty in other driver's behaviors and the trade-off between safety and agility. In this work, we develop a novel simulation environment that emulates these challenges and train a deep reinforcement learning agent that yields consistent performance in a variety of dynamic and uncertain traffic scenarios. Results show that the proposed data-driven approach performs significantly better in noisy environments compared to methods that rely solely on heuristics.

研究动机与目标

  • 解决在存在不可预测人类驾驶车辆的动态、不确定高速公路交通环境中实现安全且敏捷变道的挑战。
  • 克服基于规则的方法(如MOBIL)在传感器噪声和观测不确定性下性能下降的局限性。
  • 构建一个能够捕捉车辆动力学、自适应巡航控制(IDM)以及安全变道逻辑(MOBIL)的逼真仿真环境,以训练鲁棒的DRL智能体。
  • 在随机、动态环境中训练DRL智能体,以提升其对现实世界不确定性的泛化能力和鲁棒性。
  • 证明在不确定环境中训练的DRL智能体,其泛化能力优于在理想化、静态环境中训练的智能体。

提出的方法

  • 设计一个可配置的仿真环境,包含完整的车辆动力学,其中纵向控制采用IDM,横向决策采用MOBIL。
  • 引入受控的传感器噪声水平(±5%,±15%),以模拟真实世界中相对位置和速度测量的不确定性。
  • 使用基于占用栅格和周围车辆相对运动学的观测表示,通过深度Q网络(DQN)训练DRL智能体。
  • 定义一个奖励函数,平衡安全性(避免碰撞)、进展性(减少预计到达时间)和舒适性(平稳加减速)。
  • 训练两个智能体:一个在无行为动态的静态环境中训练,另一个在具有噪声观测的动态、随机环境中训练。
  • 通过使用IDM和MOBIL完全自主的参与者进行基准场景验证,确保公平比较。

实验结果

研究问题

  • RQ1在传感器噪声条件下,于动态、不确定环境中训练的DRL智能体与基于规则的MOBIL算法相比表现如何?
  • RQ2DRL智能体是否能在不重新训练的情况下泛化到更高水平的不确定性(如±15%的噪声)?
  • RQ3与在静态、理想化环境中训练相比,在具有真实参与者行为的动态环境中训练是否能提升智能体的鲁棒性?
  • RQ4在不确定性条件下,DRL智能体在安全性(碰撞)和效率(到达时间)方面与MOBIL相比表现如何?
  • RQ5当MOBIL失效的高风险交通场景中,DRL智能体在多大程度上能实现恢复?

主要发现

  • 在动态、中等噪声环境下训练的智能体I,在高噪声水平(±15%)下,其归一化平均奖励达到MOBIL的120%(平均奖励为1006±205),且未发生任何碰撞。
  • 在100轮中等噪声场景下,DRL智能体的平均奖励与MOBIL相当,但实现了零碰撞,而MOBIL发生了8次碰撞。
  • DRL智能体对不确定性的鲁棒性表现良好:其性能在噪声下下降幅度小于MOBIL,后者表现出显著的性能下降。
  • 在静态环境中训练的智能体II在所有设置中表现均较差,尤其在噪声环境下,其归一化奖励仅为MOBIL的58%(高噪声条件下)。
  • 仿真环境成功生成了包含多个智能体独立进行变道和速度调整的复杂、逼真的交通场景,有效支持了DRL训练。
  • 在随机、动态环境中训练显著提升了智能体在现实世界中的泛化能力,优于在理想化、确定性设置中训练的智能体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。