[论文解读] Driving Decision and Control for Autonomous Lane Change based on Deep Reinforcement Learning
本文提出了一种用于自主变道的深度强化学习框架,通过使用带有二次函数逼近的深度Q网络(DQN),将决策(是否变道)与控制(轨迹生成与路径跟踪)集成。该方法在仿真中实现了安全、舒适的变道,通过端到端学习结合纯追踪控制与多项式轨迹规划,展现出稳健性能。
We apply Deep Q-network (DQN) with the consideration of safety during the task for deciding whether to conduct the maneuver. Furthermore, we design two similar Deep Q learning frameworks with quadratic approximator for deciding how to select a comfortable gap and just follow the preceding vehicle. Finally, a polynomial lane change trajectory is generated and Pure Pursuit Control is implemented for path tracking. We demonstrate the effectiveness of this framework in simulation, from both the decision-making and control layers. The proposed architecture also has the potential to be extended to other autonomous driving scenarios.
研究动机与目标
- 开发一种基于深度强化学习的集成式决策与控制框架,用于自主变道。
- 通过基于DQN的决策策略确保变道操作的安全性。
- 利用多项式拟合生成舒适、平滑的轨迹。
- 通过纯追踪控制实现精确的路径跟踪。
- 在仿真中验证该框架在决策与控制各层的有效性。
提出的方法
- 使用带有二次函数逼近的深度Q网络(DQN)学习安全的变道决策。
- 采用两个独立的DQN框架:一个用于间隙选择,一个用于跟随前车。
- 基于多项式生成变道轨迹,以确保运动的平滑与舒适。
- 应用纯追踪控制实现对生成轨迹的精确路径跟踪。
- 在仿真驾驶环境中进行端到端的系统训练。
- 在训练过程中将安全考量直接整合到DQN的奖励函数中。
实验结果
研究问题
- RQ1深度强化学习能否在复杂交通环境中有效学习安全且舒适的变道决策?
- RQ2基于DQN与二次函数逼近的框架在不同交通条件下对变道决策的泛化能力如何?
- RQ3多项式轨迹规划在多大程度上提升了自主变道的舒适性与平滑性?
- RQ4纯追踪控制在仿真中能否可靠地跟踪生成的轨迹?
- RQ5所提出的框架在变道之外的其他自主驾驶场景中是否具有可扩展性?
主要发现
- 基于DQN的决策策略成功学习到仅在存在安全间隙时才启动变道,显著降低了碰撞风险。
- 与标准DQN相比,采用二次函数逼近显著提升了策略的稳定性和训练收敛性。
- 基于多项式的轨迹生成实现了平滑、 jerk 最小化的操作,显著提升了乘客舒适度。
- 纯追踪控制在仿真中实现了低横向误差的精确路径跟踪。
- 集成框架在多种仿真场景中均表现出稳健性能,验证了其在决策与控制各层的有效性。
- 该方法在扩展至其他自主驾驶任务(如汇入和超车)方面展现出潜在应用前景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。