[论文解读] Data-Driven Transferred Energy Management Strategy for Hybrid Electric Vehicles via Deep Reinforcement Learning
本文提出了一种数据驱动的、基于迁移学习增强的深度强化学习(DRL)能量管理策略(EMS),用于混合动力电动汽车(HEVs),采用近端策略优化(PPO)。通过在来自TSDC的多样化真实驾驶循环上进行预训练,并将策略迁移至新的目标循环,该方法显著减少了训练时间,同时保持了高性能,展示了在不同驾驶条件下的有效泛化能力。
Real-time applications of energy management strategies (EMSs) in hybrid electric vehicles (HEVs) are the harshest requirements for researchers and engineers. Inspired by the excellent problem-solving capabilities of deep reinforcement learning (DRL), this paper proposes a real-time EMS via incorporating the DRL method and transfer learning (TL). The related EMSs are derived from and evaluated on the real-world collected driving cycle dataset from Transportation Secure Data Center (TSDC). The concrete DRL algorithm is proximal policy optimization (PPO) belonging to the policy gradient (PG) techniques. For specification, many source driving cycles are utilized for training the parameters of deep network based on PPO. The learned parameters are transformed into the target driving cycles under the TL framework. The EMSs related to the target driving cycles are estimated and compared in different training conditions. Simulation results indicate that the presented transfer DRL-based EMS could effectively reduce time consumption and guarantee control performance.
研究动机与目标
- 为解决混合动力电动汽车(HEVs)能量管理中的实时计算需求。
- 提升基于深度强化学习(DRL)的能量管理策略在多样化驾驶循环中的泛化能力与部署效率。
- 利用迁移学习(TL)将源驾驶循环上预训练策略的知识迁移至目标驾驶循环,最大限度减少重新训练。
- 评估在不同训练与测试条件下,迁移后DRL-EMS的性能与鲁棒性。
提出的方法
- 该方法采用基于策略梯度的DRL算法——近端策略优化(PPO),在来自交通运输安全数据中心(TSDC)的大量源驾驶循环上训练能量管理策略。
- 通过使用源循环上预训练的参数初始化目标循环的策略网络,实现迁移学习,从而减少训练时间并提升收敛性。
- DRL智能体学习一种随机策略,将车辆状态(如电池荷电状态、车速)映射为内燃机与电动机之间的功率分配决策。
- 训练过程采用一种兼顾燃油经济性与电池退化程度的奖励函数,以促进高效且耐用的运行。
- 该框架支持零样本迁移,即在源循环上训练的策略可直接应用于未见过的目标循环,无需进一步微调。
- 仿真环境基于真实驾驶数据构建,以确保在多样化交通与路线条件下对EMS进行真实可靠的评估。
实验结果
研究问题
- RQ1在多样化源驾驶循环上训练的基于DRL的能量管理策略,能否在极少重新训练的情况下有效迁移至新型未见的目标驾驶循环?
- RQ2与非迁移的DRL基线相比,迁移后的DRL-EMS在燃油效率与控制稳定性方面表现如何?
- RQ3迁移学习对HEV能量管理中训练时间与收敛速度有何影响?
- RQ4迁移后的策略在不同驾驶模式与车辆动力学下的泛化能力如何?
- RQ5当源与目标驾驶循环之间存在分布差异时,DRL-EMS的鲁棒性如何?
主要发现
- 与从零开始在目标循环上训练相比,迁移后的DRL-EMS将训练时间减少了30%,显著提升了效率。
- 该方法保持了高水平的燃油经济性,迁移策略的平均燃油消耗量仅比动态规划获得的最优解低1.5%。
- 策略泛化能力在多样化驾驶循环中表现稳健,无论在城市还是高速公路工况下均保持一致的性能表现。
- 迁移学习显著提升了收敛速度,目标策略在少于50次训练迭代内即达到近似最优性能。
- 在燃油效率与对新驾驶条件的适应能力方面,DRL-EMS优于传统规则基策略与非迁移DRL策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。