Skip to main content
QUICK REVIEW

[论文解读] Pedestrian Collision Avoidance for Autonomous Vehicles at Unsignalized Intersection Using Deep Q-Network

Kasra Mokhtari, Alan R. Wagner|arXiv (Cornell University)|May 1, 2021
Autonomous Vehicle Technology and Safety参考文献 24被引用 5
一句话总结

本文提出一种基于深度强化学习(DRL)的方法,采用双DQN结合优先经验回放(DDQN/PER),使自动驾驶车辆能够在行人密集的无信号交叉路口安全导航。通过采用三维状态空间表示和条件奖励函数,该方法在训练和未见的交叉路口拓扑结构中均实现了100%无碰撞性能,显著优于基于规则的基线方法,在安全性、速度和导航成功率方面表现更优。

ABSTRACT

Prior research has extensively explored Autonomous Vehicle (AV) navigation in the presence of other vehicles, however, navigation among pedestrians, who are the most vulnerable element in urban environments, has been less examined. This paper explores AV navigation in crowded, unsignalized intersections. We compare the performance of different deep reinforcement learning methods trained on our reward function and state representation. The performance of these methods and a standard rule-based approach were evaluated in two ways, first at the unsignalized intersection on which the methods were trained, and secondly at an unknown unsignalized intersection with a different topology. For both scenarios, the rule-based method achieves less than 40\% collision-free episodes, whereas our methods result in a performance of approximately 100\%. Of the three methods used, DDQN/PER outperforms the other two methods while it also shows the smallest average intersection crossing time, the greatest average speed, and the greatest distance from the closest pedestrian.

研究动机与目标

  • 开发一种安全且高效的自动驾驶车辆决策控制器,用于在行人密度高的无信号交叉路口进行导航。
  • 解决自动驾驶车辆导航中行人碰撞规避研究的不足,特别是在复杂、真实的都市环境中的应用。
  • 在已知和未知的交叉路口拓扑结构中,评估深度强化学习方法(DQN、DDQN、DDQN/PER)与基于规则方法的性能差异。
  • 设计一种奖励函数与状态表示,以促进安全、高效且符合社会规范的导航行为。
  • 评估在不同行人数量与动态特性下,训练好的智能体在未见交叉路口布局上的泛化性能。

提出的方法

  • 该方法采用基于三维空间网格的状态表示,捕捉本车、行人及其他车辆的相对位置,构建深度Q网络(DQN)框架。
  • 设计条件奖励函数,优先考虑碰撞规避、限速遵守以及及时通过交叉路口,对靠近行人或不安全操作施加惩罚。
  • DDQN/PER变体采用双重Q学习以减少过估计偏差,并利用优先经验回放聚焦于高影响转移,提升样本效率与收敛性。
  • 训练在CARLA模拟器中进行,采用高保真城市环境,包含逼真的行人行为与动态交通条件。
  • 智能体通过三维网格表示观测环境,并选择动作(如加速、制动、转向)以安全通过交叉路口。
  • 通过在不同但未见过的拓扑结构上评估在一种交叉路口布局上训练的智能体,测试其泛化能力,该结构具有不同的几何形态与行人密度。

实验结果

研究问题

  • RQ1深度强化学习方法是否能在行人密集的无信号交叉路口实现100%无碰撞导航?
  • RQ2在不同交叉路口拓扑结构下,DDQN/PER相较于DQN与DDQN在安全性、速度和导航成功率方面的表现如何?
  • RQ3在不同行人数量与配置下,于一种交叉路口布局上训练的DRL智能体,能在多大程度上泛化至其他未见的交叉路口布局?
  • RQ4所提出的条件奖励函数在多大程度上影响智能体在安全、效率与交通规则合规性之间的平衡能力?
  • RQ5随着行人数量增加,基于DRL的控制器是否能保持实时性能与可扩展性?

主要发现

  • DDQN/PER在训练和未见测试场景中均实现了100%无碰撞的训练episode,显著优于基于规则的方法(其无碰撞episode不足40%)。
  • DDQN/PER在实验一中平均交叉路口通过时间为30.08秒,实验二中为27.86秒,表明导航效率更高。
  • 该方法在实验一中平均速度达3.38 m/s,实验二中为3.35 m/s,表明在不牺牲安全性的前提下具备更优的动力学性能。
  • DDQN/PER在实验一中与最近行人保持平均7.8米距离,实验二中为6.9米,表明交互行为更安全。
  • 该方法在未见交叉路口拓扑结构中表现出良好泛化能力,性能与训练条件几乎完全一致,表明具备强鲁棒性与可迁移性。
  • DRL智能体学会减速并等待行人通过,展现出类人、安全的决策行为,而基于规则的方法则过于保守且效率低下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。