Skip to main content
QUICK REVIEW

[论文解读] Cooperative Highway Work Zone Merge Control based on Reinforcement Learning in A Connected and Automated Environment

Tianzhu Ren, Yuanchang Xie|arXiv (Cornell University)|Jan 21, 2020
Traffic control and management参考文献 21被引用 5
一句话总结

本文提出了一种基于强化学习的高速公路施工区协同变道控制策略,适用于车联网与自动驾驶车辆环境。采用离策略软演员-critic(SAC)强化学习方法,封闭车道中的车辆通过利用实时交通数据,学习最优纵向位置以安全变道;同时开放车道中的两个匝道控制区提升了变道效率;该方法在通行效率与安全性方面显著优于传统的晚变道与早变道策略。

ABSTRACT

Given the aging infrastructure and the anticipated growing number of highway work zones in the United States, it is important to investigate work zone merge control, which is critical for improving work zone safety and capacity. This paper proposes and evaluates a novel highway work zone merge control strategy based on cooperative driving behavior enabled by artificial intelligence. The proposed method assumes that all vehicles are fully automated, connected and cooperative. It inserts two metering zones in the open lane to make space for merging vehicles in the closed lane. In addition, each vehicle in the closed lane learns how to optimally adjust its longitudinal position to find a safe gap in the open lane using an off-policy soft actor critic (SAC) reinforcement learning (RL) algorithm, considering the traffic conditions in its surrounding. The learning results are captured in convolutional neural networks and used to control individual vehicles in the testing phase. By adding the metering zones and taking the locations, speeds, and accelerations of surrounding vehicles into account, cooperation among vehicles is implicitly considered. This RL-based model is trained and evaluated using a microscopic traffic simulator. The results show that this cooperative RL-based merge control significantly outperforms popular strategies such as late merge and early merge in terms of both mobility and safety measures.

研究动机与目标

  • 为应对老旧基础设施与交通量增长带来的高速公路施工区安全与通行能力挑战。
  • 开发一种基于车联网与自动驾驶车辆的协同变道控制策略,以提升施工区交通流与安全性。
  • 利用强化学习实现基于动态交通状况的实时自适应变道决策。
  • 将所提方法与成熟的变道策略(如晚变道与早变道)进行对比评估。
  • 在仿真环境中验证通过隐式协调实现车辆协同行为的有效性。

提出的方法

  • 该方法在开放车道中引入两个匝道控制区,为来自封闭车道的车辆创造可控的变道间隙。
  • 封闭车道中的每辆车均采用离策略软演员-critic(SAC)强化学习算法,学习最优纵向位置。
  • 强化学习智能体通过观测周围车辆的位置、速度与加速度作为状态输入,实现实时变道决策。
  • 策略由卷积神经网络表示,以捕捉时空交通模式,支持决策制定。
  • 使用微观交通仿真环境对模型进行训练与验证,以评估其在真实条件下的性能表现。
  • 通过共享环境状态观测与协同找隙行为,实现车辆间的隐式协作。

实验结果

研究问题

  • RQ1基于强化学习的协同变道控制策略在通行效率与安全性方面,相较于传统晚变道与早变道策略表现如何?
  • RQ2开放车道中的匝道控制区在多大程度上可提升变道效率并降低冲突风险?
  • RQ3离策略SAC算法是否能有效学习在动态施工区环境中安全且高效的变道行为?
  • RQ4车辆间协同与实时交通状态感知对变道性能有何影响?
  • RQ5在该场景下,使用卷积神经网络编码交通状态以支持策略学习有何影响?

主要发现

  • 所提出的基于强化学习的策略在通行效率指标(如行程时间与通行量)方面,显著优于晚变道与早变道策略。
  • 通过优化间隙选择与协同变道,碰撞风险与冲突频率等安全性能指标显著降低。
  • 在开放车道中设置匝道控制区可有效提升变道效率,创造可预测且受控的变道机会。
  • 软演员-critic(SAC)算法展现出稳定且样本高效的训练特性,支持快速收敛至最优策略。
  • 卷积神经网络能有效编码时空交通状态,使智能体在多样化交通条件下具备良好的泛化能力。
  • 仿真结果证实,通过强化学习实现的协同行为可带来更平稳的交通流与更少的急促操作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。