Skip to main content
QUICK REVIEW

[论文解读] A Hierarchical Architecture for Sequential Decision-Making in Autonomous Driving using Deep Reinforcement Learning

Majid Moghadam, Gabriel Hugh Elkaim|arXiv (Cornell University)|Jun 20, 2019
Autonomous Vehicle Technology and Safety参考文献 12被引用 14
一句话总结

本文提出了一种用于自动驾驶决策的分层深度强化学习(DRL)架构,其中DRL智能体使用占用网格表示来生成高层级变道指令,相较于端到端方法提升了可靠性。该方法在未见过的场景中实现了100%的评估准确率,展示了在不同交通密度的随机高速公路环境中稳健的性能。

ABSTRACT

Tactical decision making is a critical feature for advanced driving systems, that incorporates several challenges such as complexity of the uncertain environment and reliability of the autonomous system. In this work, we develop a multi-modal architecture that includes the environmental modeling of ego surrounding and train a deep reinforcement learning (DRL) agent that yields consistent performance in stochastic highway driving scenarios. To this end, we feed the occupancy grid of the ego surrounding into the DRL agent and obtain the high-level sequential commands (i.e. lane change) to send them to lower-level controllers. We will show that dividing the autonomous driving problem into a multi-layer control architecture enables us to leverage the AI power to solve each layer separately and achieve an admissible reliability score. Comparing with end-to-end approaches, this architecture enables us to end up with a more reliable system which can be implemented in actual self-driving cars.

研究动机与目标

  • 为解决在随机交通条件下实现可靠高层级决策的挑战。
  • 通过分层架构将高层级决策与低层级控制解耦,以提升系统可靠性。
  • 以模块化、可解释的框架替代端到端DRL方法,增强真实部署中的安全性与泛化能力。
  • 评估不同DRL算法(DQN、DDQN)和神经网络架构在模拟高速公路环境中的性能。

提出的方法

  • 智能体使用二维占用网格作为状态表示,编码周围车辆相对于自车的位置。
  • 通过将自车的车道ID编码为二值向量,对状态空间进行增强,以保持一致的状态表示。
  • 使用经验回放和目标网络训练深度Q网络(DQN)与双DQN(DDQN),以稳定学习过程。
  • 评估三种神经网络架构(浅层、中层、深层),以确定该任务的最优模型复杂度。
  • 训练采用奖励函数,鼓励安全变道并惩罚碰撞,性能通过100个episode的平均累积奖励进行跟踪。
  • 对表现最佳的智能体(每层16个神经元的DDQN)进行100,000步评估,以检验泛化能力与无碰撞性能。

实验结果

研究问题

  • RQ1与端到端方法相比,分层DRL架构是否能提升自动驾驶决策的可靠性?
  • RQ2神经网络深度的选择如何影响高层级变道决策中DRL的性能?
  • RQ3使用占用网格状态表示是否能在随机高速公路环境中实现更好的泛化与安全性?
  • RQ4在不同DRL算法(DQN与DDQN)之间,训练速度与最终准确率之间的权衡如何?
  • RQ5智能体是否能在未见过的场景中实现100%的评估准确率,表明其具备强大的泛化能力与可靠性?

主要发现

  • 采用浅层16×16网络架构的DDQN智能体在性能与速度之间实现了最佳权衡,优于DQN及更深的网络。
  • 所有训练后的智能体在100,000步评估中均实现了100%的准确率,表明在未见过的场景中具备完美泛化与无碰撞性能。
  • 浅层网络(32个神经元)在训练过程中表现优于中层与深层架构,表明该状态表示下简单模型已足够。
  • DDQN收敛更快且达到更高的峰值奖励,证实双Q学习在减少过估计偏差方面的优势。
  • 使用占用网格作为输入实现了稳定的表示形式并提升了可解释性,支持在复杂交通场景中实现可靠决策。
  • 分层架构成功将高层级决策与低层级控制解耦,实现了模块化、可靠且安全的自动驾驶行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。