[论文解读] A Deep Reinforcement Learning Driving Policy for Autonomous Road Vehicles
本文提出一种基于深度强化学习(DRL)的驾驶策略,采用双Deep Q-Networks(DDQN)实现自动驾驶高速公路车辆的实时、无模型决策,该策略在多样化交通场景中具备良好的泛化能力。该策略实现的平均速度高于基线SUMO配置,且换道行为更具策略性,但由于缺乏保证的碰撞避免机制,导致碰撞率高达2–4%,凸显了对具备安全意识的低层控制模块的需求。
This work regards our preliminary investigation on the problem of path planning for autonomous vehicles that move on a freeway. We approach this problem by proposing a driving policy based on Reinforcement Learning. The proposed policy makes minimal or no assumptions about the environment, since no a priori knowledge about the system dynamics is required. We compare the performance of the proposed policy against an optimal policy derived via Dynamic Programming and against manual driving simulated by SUMO traffic simulator.
研究动机与目标
- 开发一种无需预先掌握系统动力学或环境模型的鲁棒、实时自动驾驶车辆驾驶策略。
- 在SUMO中评估DRL策略相对于最优动态规划解法和人工驾驶仿真配置的性能表现。
- 研究DRL策略在复杂、混合交通环境中不同驾驶员行为下的泛化能力与稳定性。
- 识别基于学习的策略在碰撞避免方面的局限性,并提出实现安全部署的可行路径。
提出的方法
- 驾驶策略通过双Deep Q-Network(DDQN)实现,从原始状态观测中学习最优动作,无需显式建模环境。
- 状态表示包含周围车辆的相对位置与速度,使智能体能够在不预先假设的前提下感知交通上下文。
- 奖励函数旨在最小化纵向与横向加速度,提升乘客舒适度,同时鼓励前进并避免碰撞。
- 训练在基于SUMO的交通仿真环境中进行,包含三车道高速公路及人工驾驶与自动驾驶车辆的混合配置。
- 通过在不同交通密度和驾驶员不完美程度(σ = 0.0 和 σ = 0.5)下评估,检验策略的鲁棒性。
- 性能与SUMO默认行为及人工驾驶行为进行对比,测量碰撞次数、换道次数与平均速度。
实验结果
研究问题
- RQ1基于DRL的驾驶策略是否能在不了解车辆动力学或环境模型的前提下,泛化到未见过的交通场景?
- RQ2与最优动态规划解法及人工驾驶相比,DDQN策略在速度、安全性与操控性能方面的表现如何?
- RQ3在基于学习的策略中,驾驶效率(速度与换道次数)与安全性(碰撞率)之间存在何种权衡?
- RQ4驾驶员不完美性(σ = 0.5)如何影响DRL策略在类真实交通环境下的稳定性与性能?
主要发现
- 当慢速车辆以18 m/s行驶时,DDQN策略实现了20.71 m/s的平均速度,优于SUMO默认配置(20.22 m/s)和SUMO人工驾驶配置(19.48 m/s)。
- 该策略平均每场景完成1.93次换道,显著高于SUMO默认配置(0.99次)和SUMO人工驾驶配置(0.0次),表明其具备更策略性的换道行为。
- 尽管速度与换道行为更优,但在理想驾驶条件(σ = 0.0)下,该策略仍存在2%的碰撞率,表明其缺乏保证的安全性。
- 在驾驶员不完美条件(σ = 0.5)下,碰撞率上升至3–4%,显示出对交通波动性的敏感性。
- 该策略在不同场景中表现出良好的泛化能力,并在多种速度设定与驾驶员行为下保持一致的性能表现。
- 结果表明,尽管DRL策略可实现高效率与良好泛化,但仍需与具备安全意识的低层控制机制集成,以确保无碰撞运行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。