Skip to main content
QUICK REVIEW

[论文解读] Learning Interaction-aware Guidance Policies for Motion Planning in Dense Traffic Scenarios

Bruno Brito, Achin Agarwal|arXiv (Cornell University)|Jul 9, 2021
Autonomous Vehicle Technology and Safety参考文献 59被引用 14
一句话总结

本文提出一种交互感知的深度强化学习(DRL)策略,为模型预测控制(MPC)规划器提供速度参考,以在密集交通中实现安全高效的变道,通过推理其他车辆的协作性来实现。与基于学习和基于优化的基线方法相比,该方法在高速公路变道和无保护左转场景中显著降低了碰撞率并提高了成功率。

ABSTRACT

Autonomous navigation in dense traffic scenarios remains challenging for autonomous vehicles (AVs) because the intentions of other drivers are not directly observable and AVs have to deal with a wide range of driving behaviors. To maneuver through dense traffic, AVs must be able to reason how their actions affect others (interaction model) and exploit this reasoning to navigate through dense traffic safely. This paper presents a novel framework for interaction-aware motion planning in dense traffic scenarios. We explore the connection between human driving behavior and their velocity changes when interacting. Hence, we propose to learn, via deep Reinforcement Learning (RL), an interaction-aware policy providing global guidance about the cooperativeness of other vehicles to an optimization-based planner ensuring safety and kinematic feasibility through constraint satisfaction. The learned policy can reason and guide the local optimization-based planner with interactive behavior to pro-actively merge in dense traffic while remaining safe in case the other vehicles do not yield. We present qualitative and quantitative results in highly interactive simulation environments (highway merging and unprotected left turns) against two baseline approaches, a learning-based and an optimization-based method. The presented results demonstrate that our method significantly reduces the number of collisions and increases the success rate with respect to both learning-based and optimization-based baselines.

研究动机与目标

  • 解决在驾驶员意图不可观测且交互行为至关重要的密集交通环境中自动驾驶车辆导航的挑战。
  • 克服因缺乏交互建模而导致的保守或不安全运动规划在密集场景中的局限性。
  • 开发一种可扩展、安全且具备交互能力的运动规划框架,利用类人交互线索(距离和时间头驰)指导规划。
  • 将深度强化学习与基于优化的规划相结合,实现实时场景下安全、可行性与性能的平衡。
  • 在合作、混合及非合作交通条件下,提升高速公路变道和无保护左转等复杂操作的成功率,并降低碰撞率。

提出的方法

  • 通过深度强化学习(DRL)学习一种交互感知策略,将观测状态(相对位置、速度和头驰)映射为速度参考。
  • 使用相对距离和时间头驰作为驾驶员协作性的代理指标,将其转化为指导规划的速率指令。
  • 将DRL策略作为全局引导信号集成到局部基于优化的规划器(MPCC)中,以强制执行运动学和碰撞约束。
  • 通过约束确保安全性和可行性的MPCC问题公式化,将DRL策略生成的参考速度作为输入。
  • 联合训练DRL策略与MPCC,并对不可行解施加惩罚,以提高求解器的可靠性并减少死锁。
  • 训练期间使用恒定速度模型模拟其他车辆,未来工作计划扩展为基于数据驱动的交互感知预测模型。

实验结果

研究问题

  • RQ1在无显式通信的情况下,自动驾驶车辆如何有效推理其他驾驶员在密集交通中的协作性?
  • RQ2基于DRL的策略若能从交互线索(距离和时间头驰)中学习,是否可提升复杂操作中的运动规划性能?
  • RQ3将学习到的交互策略与约束优化规划器结合,与纯基于学习或纯基于优化的方法相比,在安全性和成功率方面表现如何?
  • RQ4在密集交通场景中,引入碰撞避免约束在多大程度上影响到达目标的时间和可行性?
  • RQ5所提出的框架能否实现适合实际自动驾驶车辆部署的实时性能?

主要发现

  • 在合作、混合及非合作环境中,所提出的IntMPC方法相较于DRL-only基线和MPCC-only基线,显著降低了碰撞率。
  • 在合作与混合环境中,IntMPC在成功率方面相较于两个基线均实现统计上显著的提升,且更多成功变道发生在合作车辆附近(如图6所示)。
  • 该方法在到达目标时间上与DRL基线和MPCC基线保持相当,且在所有环境中各方法间到达目标时间无统计学差异,表明新增安全约束未带来性能损失。
  • 当DRL策略与控制器联合训练时,MPCC求解器的不可行解数量显著减少,原因在于对不可行状态-动作对施加了惩罚信号。
  • DRL策略平均计算耗时1.35 ± 0.5 ms,MPCC平均求解耗时3.0 ± 1.35 ms,表明在所有交通设置下均具备实时可行性。
  • 该方法通过主动利用车辆协作性成功穿越密集交通,仅有少量成功变道发生在非合作车辆附近,主要由于IDM参数的随机变化导致短暂间隙出现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。