[论文解读] Transfer Deep Reinforcement Learning-based Large-scale V2G Continuous Charging Coordination with Renewable Energy Sources
本文提出了一种基于近端策略优化(PPO)的深度强化学习(DRL)框架,用于大规模车网互动(V2G)系统中与可再生能源发电(RES)协同的连续充放电协调。该方法在电池荷电状态(SOC)约束下,对聚合商及单个电动汽车(EV)实现了实时功率调度优化,与无控制充电相比,负载波动降低了97.37%,充电成本降低了76.56%。
Due to the increasing popularity of electric vehicles (EVs) and the technological advancement of EV electronics, the vehicle-to-grid (V2G) technique and large-scale scheduling algorithms have been developed to achieve a high level of renewable energy and power grid stability. This paper proposes a deep reinforcement learning (DRL) method for the continuous charging/discharging coordination strategy in aggregating large-scale EVs in V2G mode with renewable energy sources (RES). The DRL coordination strategy can efficiently optimize the electric vehicle aggregator's (EVA's) real-time charging/discharging power with the state of charge (SOC) constraints of the EVA and the individual EV. Compared with uncontrolled charging, the load variance is reduced by 97.37$\%$ and the charging cost by 76.56$\%$. The DRL coordination strategy further demonstrates outstanding transfer learning ability to microgrids with RES and large-scale EVA, as well as the complicated weekly scheduling. The DRL coordination strategy demonstrates flexible, adaptable, and scalable performance for the large-scale V2G under realistic operating conditions.
研究动机与目标
- 解决大规模电动汽车(EV)与可再生能源发电(RES)并网过程中负载波动大和充电成本高的挑战。
- 为车网互动(V2G)系统开发一种实时、可扩展的协调策略,确保聚合商及单个EV的SOC约束得到满足。
- 在可再生能源发电(RES)集成的多样化微电网条件下,实现高效、自适应且可迁移的调度。
- 通过强制执行SOC约束,最小化负载波动和EV充电成本,同时保障电池寿命。
- 证明连续动作DRL在大规模V2G协调中优于离散DRL和群智能方法。
提出的方法
- 采用近端策略优化(PPO)——一种连续动作深度强化学习算法,优化大规模EV聚合商的实时充放电功率。
- 在聚合商的荷电状态(SOC)和单个EV的SOC上施加硬性约束,以确保驾驶需求和电池健康不受影响。
- 设计一种奖励函数,以最小化负载波动,并引入分时电价(TOU)以降低运行成本。
- 采用集中式动作空间,由电动汽车聚合器(EVA)根据实时SOC和电网状况为各EV分配功率。
- 引入迁移学习能力,使预训练策略可泛化至不同微电网场景与可再生能源渗透水平。
- 利用端到端DRL,直接从传感器输入学习最优策略,无需依赖显式预测模型。
实验结果
研究问题
- RQ1基于连续动作DRL的协调策略是否能有效降低大规模V2G系统在可再生能源发电(RES)集成背景下的负载波动和充电成本?
- RQ2在动态电网条件下,所提出的PPO-based DRL策略在聚合商和单个EV的SOC约束维持方面表现如何?
- RQ3通过迁移学习,DRL策略在不同微电网配置和可再生能源渗透水平下的泛化能力如何?
- RQ4与无控制充电、粒子群优化(PSO)及离散DRL(如DQN)相比,该方法在负载波动和成本降低方面表现如何?
- RQ5该DRL策略是否能在不依赖预测数据的情况下实现实时运行,从而适应不可预测的EV行为和电网波动?
主要发现
- 与基线负载测试系统中的无控制充电相比,DRL协调策略使负载波动降低了97.37%。
- 与无控制充电相比,充电成本降低了76.56%,无控制充电条件下的成本为9074.4元人民币。
- 在可再生能源发电(RES)存在的情况下,该策略使负载波动降低89.03%,充电成本降低81.41%。
- 在一周全周期调度场景中,该方法使负载波动降低95.04%(基线负载)和83.08%(含RES),展现出强大的可扩展性。
- 与PSO和离散DRL(如DQN)相比,基于PPO的DRL方法在连续动作空间下表现出更优的稳定性、收敛性和性能。
- 该策略将单个EV的SOC维持在安全范围(0.2–0.9)内,并确保EVA在出发时间的SOC保持在0.8至0.9之间,从而保障电池健康与可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。