Skip to main content
QUICK REVIEW

[论文解读] Safe Deep Q-Network for Autonomous Vehicles at Unsignalized Intersection

Kasra Mokhtari, Alan R. Wagner|arXiv (Cornell University)|Jun 8, 2021
Autonomous Vehicle Technology and Safety参考文献 22被引用 4
一句话总结

该论文提出了一种用于自动驾驶车辆在无信号交叉路口与行人共行时的安全深度强化学习(DRL)框架,采用两个长短期记忆(LSTM)网络来估计在噪声观测下的行人轨迹和感知环境状态。一个未来碰撞预测模块对不安全动作进行屏蔽,实现在CARLA仿真中训练和未见过的交叉路口拓扑结构下均实现0%的碰撞率,同时保持合理的速度和高效的导航性能。

ABSTRACT

We propose a safe DRL approach for autonomous vehicle (AV) navigation through crowds of pedestrians while making a left turn at an unsignalized intersection. Our method uses two long-short term memory (LSTM) models that are trained to generate the perceived state of the environment and the future trajectories of pedestrians given noisy observations of their movement. A future collision prediction algorithm based on the future trajectories of the ego vehicle and pedestrians is used to mask unsafe actions if the system predicts a collision. The performance of our approach is evaluated in two experiments using the high-fidelity CARLA simulation environment. The first experiment tests the performance of our method at intersections that are similar to the training intersection and the second experiment tests our method at intersections with a different topology. For both experiments, our methods do not result in a collision with a pedestrian while still navigating the intersection at a reasonable speed.

研究动机与目标

  • 开发一种安全的强化学习方法,用于自动驾驶车辆在行人行为不可预测的拥挤无信号交叉路口中导航。
  • 解决真实自动驾驶场景中传感器观测存在噪声和不完整的问题。
  • 在保持合理速度和任务完成率的同时,确保无碰撞导航。
  • 在单一配置上进行训练后,评估策略在不同交叉路口拓扑结构上的泛化能力。
  • 在不损害性能或实时可行性的情况下,将安全约束集成到深度强化学习中。

提出的方法

  • 训练两个长短期记忆(LSTM)网络,以从噪声观测中估计环境的感知状态并预测未来的行人轨迹。
  • 采用未来碰撞预测算法,利用预测的行人轨迹评估本车与行人之间潜在的碰撞。
  • 若系统预测未来可能发生碰撞,则在DRL策略中屏蔽不安全动作,从而在探索和部署过程中强制实现安全。
  • DRL智能体使用双深度Q网络(DDQN)结合优先经验回放(PER),以提高训练稳定性和样本效率。
  • 设计了一种条件奖励函数,以鼓励安全、及时的导航,同时惩罚碰撞和过度延迟。
  • 在高保真CARLA仿真环境中对框架进行评估,模拟真实传感器噪声和多样的交叉路口几何结构。

实验结果

研究问题

  • RQ1基于DRL的控制策略是否能在行人密集的无信号交叉路口实现自动驾驶导航过程中的零碰撞?
  • RQ2与标准DRL相比,LSTM感知与未来碰撞检测的集成在噪声观测下如何提升安全性?
  • RQ3在单一交叉路口拓扑结构上训练的策略,能在多大程度上泛化到不同且未见过的交叉路口布局?
  • RQ4与基于规则的基线方法相比,所提出的安全部DRL方法在碰撞率、速度和导航效率方面表现如何?
  • RQ5信念更新LSTM在提升实时决策中对感知噪声的鲁棒性方面起到了什么作用?

主要发现

  • 所提出的安全部DRL方法在两次实验中均实现了0%的碰撞率,优于基于规则的基线和标准DRL智能体。
  • SRL智能体在实验1中用时28.12秒,在实验2中用时28.61秒,平均速度分别为3.25米/秒和3.27米/秒。
  • SRL智能体与最近行人保持的平均距离分别为7.19米和7.21米,表明其交互行为更安全。
  • 未来碰撞检测模块与SRL智能体均实现了零碰撞,而标准RL智能体因噪声观测导致6%的碰撞率。
  • 信念更新LSTM显著提升了对感知噪声的鲁棒性:未使用该模块的纯RL智能体碰撞率为6%,而SRL版本为0%。
  • 该方法在不同交叉路口拓扑结构上表现出良好的泛化能力,在训练环境和未见环境中均保持一致的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。