Skip to main content
QUICK REVIEW

[论文解读] Safe Trajectory Planning Using Reinforcement Learning for Self Driving

Josiah Coad, Zhiqian Qiao|arXiv (Cornell University)|Nov 9, 2020
Autonomous Vehicle Technology and Safety参考文献 26被引用 5
一句话总结

该论文提出了一种无需模型的强化学习(RL)方法,用于自动驾驶汽车的轨迹规划,通过将运动规划与直接控制解耦,提升了安全性和舒适性。通过训练一个RL智能体在连续动作空间中生成平滑、安全的轨迹——同时利用后处理过滤器强制执行安全约束——该方法相比离散搜索或端到端控制方法,实现了更快的推理速度、更低的加加加速度(jerk)和更低的碰撞风险。

ABSTRACT

Self-driving vehicles must be able to act intelligently in diverse and difficult environments, marked by high-dimensional state spaces, a myriad of optimization objectives and complex behaviors. Traditionally, classical optimization and search techniques have been applied to the problem of self-driving; but they do not fully address operations in environments with high-dimensional states and complex behaviors. Recently, imitation learning has been proposed for the task of self-driving; but it is labor-intensive to obtain enough training data. Reinforcement learning has been proposed as a way to directly control the car, but this has safety and comfort concerns. We propose using model-free reinforcement learning for the trajectory planning stage of self-driving and show that this approach allows us to operate the car in a more safe, general and comfortable manner, required for the task of self driving.

研究动机与目标

  • 解决传统轨迹规划方法的局限性,这些方法依赖于离散搜索和数值优化,计算成本高且轨迹不够平滑。
  • 通过将轨迹规划与底层控制解耦,克服端到端强化学习控制在安全性和可解释性方面的挑战。
  • 在高维、复杂的驾驶环境中,利用可微分的连续动作强化学习策略,实现更安全、更舒适、更快的轨迹生成。
  • 通过在控制执行前过滤不安全轨迹,将安全约束集成到强化学习流程中,确保符合物理和操作限制。
  • 证明基于强化学习的规划在轨迹平滑度、计算效率和安全性方面优于穷举式离散搜索和端到端控制方法。

提出的方法

  • 使用无模型的深度强化学习智能体(PPO)在连续动作空间中规划完整轨迹,输入为感知信息(占用网格和限速信息)。
  • 将轨迹规划与直接控制解耦:RL策略输出轨迹,随后由独立的PID控制器进行跟踪。
  • 应用安全约束模块(算法1),拒绝任何违反安全规则的轨迹(如偏离道路、碰撞、过度曲率或加速度)。
  • 使用密集且形状化的奖励函数进行RL策略训练,该函数惩罚偏离道路、高曲率、过度加速度/加加加速度以及额外行驶距离。
  • 策略网络和价值网络均采用全连接神经网络(64-64个单元),使用标准超参数的近端策略优化(PPO)进行训练。
  • 利用离策略数据收集和课程学习,提升仿真环境中的样本效率和训练稳定性。

实验结果

研究问题

  • RQ1无模型强化学习能否在保持安全性和舒适性的前提下,有效用于自动驾驶汽车的轨迹规划?
  • RQ2与穷举式离散搜索相比,基于强化学习的轨迹规划在计算速度和轨迹平滑度方面表现如何?
  • RQ3能否在不损害策略性能的前提下,有效对强化学习生成的轨迹施加安全约束?
  • RQ4与端到端控制方法相比,基于强化学习的规划是否能降低加加加速度并提升乘坐舒适性?
  • RQ5该强化学习策略能否在具有不同障碍物配置和限速的多样化驾驶场景中泛化,而无需重新训练?

主要发现

  • 在1000集实验中,与穷举搜索相比,基于强化学习的规划器将平均速度跟踪误差降低了29%(5.306 ± 0.126 vs. 7.582 ± 0.195)。
  • 该RL策略将最大加加加速度降低了52%(0.194 ± 0.005 vs. 0.407 ± 0.012),最大曲率降低了59%(0.304 ± 0.010 vs. 0.738 ± 0.026),表明轨迹显著更平滑。
  • 推理时间实现了10倍加速(8.7×10⁻⁴ s vs. 7.9×10⁻³ s),适合实时部署。
  • 安全约束机制在静态环境中成功防止了所有碰撞,成功率高达100%,即使RL策略最初提出了不安全路径。
  • 该RL策略使额外行驶距离减少了43%(0.185 ± 0.007 vs. 0.317 ± 0.011),最大向心加速度降低了16%(1.147 ± 0.036 vs. 1.367 ± 0.058),提升了安全性和舒适性。
  • 该RL策略在多样化场景中泛化良好,包括多车道道路、静态障碍物和可变限速情况,无需重新训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。