Skip to main content
QUICK REVIEW

[论文解读] Eco-driving for Electric Connected Vehicles at Signalized Intersections: A Parameterized Reinforcement Learning approach

Xia Jiang, Jian Zhang|arXiv (Cornell University)|Jun 24, 2022
Traffic control and management参考文献 43被引用 4
一句话总结

本文提出了一种参数化强化学习(PRL)框架,用于在信号交叉口实现电动汽车联网车辆的经济驾驶,通过整合基于模型的跟驰与变道策略,并采用分层动作空间,联合优化纵向与横向控制。该方法在非协调信号设置下将能耗降低高达27.13%,且未对人类驾驶车辆(HDVs)造成干扰。

ABSTRACT

This paper proposes an eco-driving framework for electric connected vehicles (CVs) based on reinforcement learning (RL) to improve vehicle energy efficiency at signalized intersections. The vehicle agent is specified by integrating the model-based car-following policy, lane-changing policy, and the RL policy, to ensure safe operation of a CV. Subsequently, a Markov Decision Process (MDP) is formulated, which enables the vehicle to perform longitudinal control and lateral decisions, jointly optimizing the car-following and lane-changing behaviors of the CVs in the vicinity of intersections. Then, the hybrid action space is parameterized as a hierarchical structure and thereby trains the agents with two-dimensional motion patterns in a dynamic traffic environment. Finally, our proposed methods are evaluated in SUMO software from both a single-vehicle-based perspective and a flow-based perspective. The results show that our strategy can significantly reduce energy consumption by learning proper action schemes without any interruption of other human-driven vehicles (HDVs).

研究动机与目标

  • 通过智能控制提升电动汽车联网车辆(CVs)在信号交叉口的能效。
  • 解决基于规则和基于优化的经济驾驶策略在动态交通环境中的局限性。
  • 开发一种基于学习的控制框架,联合优化纵向与横向车辆决策。
  • 确保在混合交通场景中部署CV时对人类驾驶车辆(HDVs)的干扰最小化。
  • 评估所提方法在不同CV市场渗透率(MPR)和交通流量下的可扩展性与鲁棒性。

提出的方法

  • 建立马尔可夫决策过程(MDP)以建模交叉口处纵向与横向控制决策的联合优化。
  • 引入一种参数化为分层结构的混合动作空间,以表示二维运动模式。
  • 将基于模型的跟驰与变道策略与参数化深度强化学习(PRL)智能体相结合。
  • 采用复合奖励函数,结合步骤奖励与终端奖励,以引导策略学习。
  • 利用深度强化学习训练PRL智能体,基于SPaT(信号相位与配时)数据学习最优速度轨迹与变道决策。
  • 在SUMO仿真中验证该框架,涵盖协调与非协调信号设置下的单智能体与多智能体场景。

实验结果

研究问题

  • RQ1参数化强化学习框架能否有效降低电动汽车联网车辆在信号交叉口的能耗?
  • RQ2与DQN和DDPG相比,所提出的PRL方法在能效与稳定性方面表现如何?
  • RQ3在部署CV时,该框架在多大程度上维持了人类驾驶车辆(HDVs)的交通效率?
  • RQ4CV的市场渗透率(MPR)如何影响整个交通系统的能耗与通行性能?
  • RQ5该方法在协调与非协调信号环境中表现是否更优?

主要发现

  • 当CV MPR为1时,与纯HDV场景相比,PRL框架使平均电能消耗降低13.8%。
  • 在非协调信号设置下,与基线策略相比,该方法实现27.13%的能耗降低。
  • 在协调信号设置下,与基线相比,该方法使能耗降低4.1%,表明其在不同信号类型下均表现稳定。
  • HDV的平均速度在不同MPR水平和交通流量下保持稳定,表明对人类驾驶交通无显著干扰。
  • 在动态交通条件下,PRL控制器在能效与稳定性方面均优于DQN与DDPG。
  • 即使在高MPR水平下,该框架仍保持较低的速度降低(最小的通行能力损失),证实其在实际部署中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。