Skip to main content
QUICK REVIEW

[论文解读] A Deep Reinforcement Learning Framework for Eco-driving in Connected and Automated Hybrid Electric Vehicles

Zhaoxuan Zhu, Shobhit Gupta|arXiv (Cornell University)|Jan 13, 2021
Vehicle emissions and performance参考文献 45被引用 10
一句话总结

本文提出一种基于深度强化学习(DRL)的框架,采用近端策略优化(PPO)与长短期记忆网络(LSTM),以解决联网与自动驾驶混合动力汽车(HEVs)的经济驾驶问题。通过将问题建模为部分可观测马尔可夫决策过程(POMDP),并在模拟的城市环境中进行训练,该DRL控制器相比人类驾驶基线实现17.5%的燃油消耗降低,同时保持相近的行驶时间。

ABSTRACT

Connected and Automated Vehicles (CAVs), in particular those with multiple power sources, have the potential to significantly reduce fuel consumption and travel time in real-world driving conditions. In particular, the Eco-driving problem seeks to design optimal speed and power usage profiles based upon look-ahead information from connectivity and advanced mapping features, to minimize the fuel consumption over a given itinerary. In this work, the Eco-driving problem is formulated as a Partially Observable Markov Decision Process (POMDP), which is then solved with a state-of-art Deep Reinforcement Learning (DRL) Actor Critic algorithm, Proximal Policy Optimization. An Eco-driving simulation environment is developed for training and evaluation purposes. To benchmark the performance of the DRL controller, a baseline controller representing the human driver, a trajectory optimization algorithm and the wait-and-see deterministic optimal solution are presented. With a minimal onboard computational requirement and a comparable travel time, the DRL controller reduces the fuel consumption by more than 17% compared against the baseline controller by modulating the vehicle velocity over the route and performing energy-efficient approach and departure at signalized intersections, over-performing the more computationally demanding trajectory optimization method

研究动机与目标

  • 开发一种适用于联网与自动驾驶混合动力汽车(CAVs)的实时、计算高效的经济驾驶控制器,基于深度强化学习。
  • 解决在联网与信号灯控制约束下,联合速度轨迹与动力总成控制的高维、约束优化问题。
  • 将DRL策略与人类行为基线、确定性模型预测控制(MPC)以及一种“等待并查看”的最优解进行基准对比。
  • 设计一种奖励函数,通过稀疏但高量级的惩罚,强制实现交通信号合规性、电池约束与燃油效率。
  • 实现一种离线学习、线上执行的部署策略,适用于实际应用,且车载计算负载较低。

提出的方法

  • 将经济驾驶问题建模为部分可观测马尔可夫决策过程(POMDP),以模拟交通信号与车辆状态中的不确定性。
  • 采用近端策略优化(PPO)算法,并使用长短期记忆网络(LSTM)作为函数逼近器,构建深度强化学习(DRL)智能体,以捕捉时间依赖性。
  • 设计一个综合奖励函数,包含归一化的、基于约束的分量:$ r_{\text{vel}} $、$ r_{\text{batt}} $、$ r_{\text{tfc}} $ 与 $ r_{\text{obj}} $,其中约束惩罚的量级远大于性能奖励。
  • 在高保真仿真环境中训练DRL智能体,该环境结合了轻型HEV动力总成模型与基于SUMO的微观交通仿真,以实现真实的城市与高速公路场景。
  • 通过40个CPU与1个GPU并行训练,提升样本效率与收敛稳定性。
  • 采用截断的时间差分学习,结合广义优势估计(GAE)与熵正则化,以提升策略探索能力与稳定性。

实验结果

研究问题

  • RQ1基于DRL的控制器是否能在联网与自动驾驶混合动力汽车中实现显著的燃油节省,同时保持与人类驾驶员相近的行驶时间?
  • RQ2在真实驾驶条件下,DRL控制器与人类行为基线、确定性MPC方法及“等待并查看”最优解相比,性能如何?
  • RQ3具有稀疏奖励结构的预训练策略在多大程度上能有效学习避免交通信号违规并维持电池约束?
  • RQ4DRL策略对超参数变化的鲁棒性如何?PPO算法是否能确保训练稳定且调参需求最少?
  • RQ5该框架能否扩展以支持个性化驾驶行为或生态自适应巡航控制(ACC)场景下的前车交互?

主要发现

  • 在城市、混合城区及高速公路条件下,DRL控制器在100次随机生成的行程中,相比人类驾驶基线策略,平均燃油消耗降低17.5%。
  • DRL策略保持了与基线相近的行驶时间,表明燃油效率的提升并未以增加行程时长为代价。
  • 尽管车载计算资源要求更低,DRL控制器在燃油经济性方面仍优于计算更密集的确定性MPC方法。
  • 奖励函数设计(如 $ c_{\text{batt}} = -10 $ 的高量级约束惩罚)成功实现了对电池状态与交通信号合规性的强制约束,显著减少了违规行为。
  • 基于LSTM的函数逼近与PPO算法结合,在多种交通场景下表现出稳健性能,且对超参数调优的敏感度极低。
  • 仿真环境成功捕捉了真实世界中的复杂因素,如信号灯控制、地形变化与交通动态,从而支持可靠策略的训练与评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。