Skip to main content
QUICK REVIEW

[论文解读] Lane Change Decision-making through Deep Reinforcement Learning with Rule-based Constraints

Junjie Wang, Qichao Zhang|arXiv (Cornell University)|Mar 30, 2019
Autonomous Vehicle Technology and Safety参考文献 17被引用 12
一句话总结

本文提出了一种基于规则的深度Q网络(DQN)方法,用于自主变道决策,通过将高层DQN策略学习与低层基于规则的轨迹约束相结合,确保安全性和效率。该方法在真实世界模拟环境中相比基线DQN和基于规则的方法,实现了更高的平均速度(46.99英里/小时)、更少的变道次数(每集8.80次)以及更高的安全性(80%的安全率)。

ABSTRACT

Autonomous driving decision-making is a great challenge due to the complexity and uncertainty of the traffic environment. Combined with the rule-based constraints, a Deep Q-Network (DQN) based method is applied for autonomous driving lane change decision-making task in this study. Through the combination of high-level lateral decision-making and low-level rule-based trajectory modification, a safe and efficient lane change behavior can be achieved. With the setting of our state representation and reward function, the trained agent is able to take appropriate actions in a real-world-like simulator. The generated policy is evaluated on the simulator for 10 times, and the results demonstrate that the proposed rule-based DQN method outperforms the rule-based approach and the DQN method.

研究动机与目标

  • 解决在复杂、不确定交通环境中自动驾驶车辆实现安全高效变道决策的挑战。
  • 克服纯基于规则系统在未知场景下缺乏泛化能力的局限性。
  • 通过整合基于规则的约束来改进标准DQN,以在学习过程中提升安全性和可靠性。
  • 在包含密集和稀疏交通条件的逼真仿真环境中评估所提出方法。
  • 证明将高层深度强化学习与低层基于规则的轨迹修正相结合,可在速度、效率和安全性方面实现更优性能。

提出的方法

  • 训练一个深度Q网络(DQN),基于包含周围车辆相对位置、速度和车道信息的状态表示,做出高层横向变道决策。
  • 状态表示被设计为捕捉决策相关的环境上下文,包括本车状态和周围交通动态。
  • 采用自定义奖励函数,通过惩罚变道偏离、碰撞和过度变道,同时奖励前进进度和顺畅过渡,以鼓励安全高效的行驶行为。
  • 在低层轨迹生成阶段应用基于规则的约束,以校正和验证DQN生成的动作,确保运动学可行性并避免碰撞。
  • 使用ε-greedy探索策略,ε值随时间衰减(ε₀ = 1.0,λ_decay = 0.99985,ε_min = 0.03),以在探索与利用之间取得平衡。
  • 训练过程包含100个回合,每个回合在实时环境中模拟完成一圈,代理在每回合结束后重新开始。

实验结果

研究问题

  • RQ1基于DQN的智能体是否能在复杂、接近真实世界的交通仿真环境中学习到有效的变道策略?
  • RQ2与纯DQN或基于规则的系统相比,集成基于规则的约束在多大程度上提升了DRL驱动变道决策的安全性和可靠性?
  • RQ3所提出的方法在多大程度上减少了变道频率,同时保持或提升平均速度?
  • RQ4基于规则的DQN方法是否在安全性、效率和泛化能力之间实现了优于基线方法的更好平衡?
  • RQ5状态表示、奖励函数设计和基于规则的轨迹校正等不同组件在最终性能中分别起到了什么贡献?

主要发现

  • 基于规则的DQN方法实现了最高的平均速度(46.99英里/小时),优于基于规则的策略(45.22英里/小时)和仅DQN的基线(46.16英里/小时)。
  • 所提方法将每集平均变道次数降低至8.80次,显著低于仅DQN基线(37.40次),且与基于规则的策略(8.40次)相当。
  • 基于规则的DQN实现了80%的安全率,远高于仅DQN基线(20%)和基于规则的策略(60%),表明其碰撞避免能力显著提升。
  • 训练过程显示平均速度随时间增加,变道频率逐渐下降,表明策略学习有效且已收敛。
  • 该方法成功在高速性能与减少操作频率之间取得平衡,展示了更优的效率与安全性权衡。
  • 集成基于规则的轨迹约束显著提升了DRL决策的安全性,同时未损害学习效率或性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。