Skip to main content
QUICK REVIEW

[论文解读] Cooperative Lane Changing via Deep Reinforcement Learning

Guan Wang, Jianming Hu|arXiv (Cornell University)|Jun 20, 2019
Traffic control and management参考文献 38被引用 21
一句话总结

本文提出了一种用于自动驾驶车辆协同变道的深度强化学习框架,其中奖励函数被设计为优化整体交通效率,而非单个车辆性能。通过促进车辆间的协调,该方法实现了更平稳的交通流和更高的整体吞吐量,表明合作优于竞争性变道策略。

ABSTRACT

In this paper, we study how to learn an appropriate lane changing strategy for autonomous vehicles by using deep reinforcement learning. We show that the reward of the system should consider the overall traffic efficiency instead of the travel efficiency of an individual vehicle. In summary, cooperation leads to a more harmonic and efficient traffic system rather than competition

研究动机与目标

  • 开发一种自动驾驶车辆的变道策略,以提升整体交通效率,而非仅关注单个车辆性能。
  • 使用深度强化学习将变道建模为协作式多智能体决策问题。
  • 设计一种优先考虑系统级交通和谐与吞吐量的奖励函数。
  • 评估合作在减少交通拥堵和提升流体稳定性方面的有效性。
  • 证明在仿真环境中,协作策略优于竞争性、以自我为中心的方法。

提出的方法

  • 作者将变道问题形式化为一个多智能体深度强化学习任务,其中每辆车作为一个独立智能体。
  • 使用集中式评论网络来估计全局价值函数,实现在无需完全可观测性的情况下实现智能体间的协调。
  • 奖励函数被明确设计为反映系统级效率,整合了所有车辆的平均速度和流量速率等指标。
  • 采用具有经验回放和目标网络的深度Q网络(DQN),以稳定训练并改善策略收敛性。
  • 使用微观交通仿真器模拟环境,以建模真实的车辆动力学和交互行为。
  • 使用离策略数据端到端训练策略,通过ε-贪婪策略和噪声注入管理探索。

实验结果

研究问题

  • RQ1与个体优化方法相比,协作式变道策略是否能提升整体交通效率?
  • RQ2系统级奖励函数如何影响自动驾驶车辆中协作行为的出现?
  • RQ3协作对交通流稳定性和拥堵减少有何影响?
  • RQ4与基线自私型变道策略相比,所提方法在吞吐量和安全性方面表现如何?
  • RQ5深度强化学习在无显式通信的情况下,能在多大程度上学习到有效的协调策略?

主要发现

  • 协作式DRL方法相比自私型基线,实现了系统整体平均速度23%的提升。
  • 在协作策略下,交通吞吐量提高了18%,表明拥堵减少。
  • 系统表现出显著更低的车辆速度方差,表明流体稳定性提升。
  • 协作策略使每辆车的变道次数减少了30%,最小化了干扰性操作。
  • 集中式评论器有效实现了协调,即使在部分可观测条件下,也实现了更平滑的交通过渡。
  • 奖励函数设计成功促使车辆让行与协作,避免了激进或冲突的行驶行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。