[论文解读] Dynamic Energy Dispatch in Isolated Microgrids Based on Deep Reinforcement Learning.
本文提出 FH-DDPG 和 FH-RDPG 两种新型深度强化学习算法,用于具有柴油发电机、光伏和电池的孤立微电网中的动态电能调度。通过将问题建模为有限时域部分可观测马尔可夫决策过程(POMDP),并从历史数据中学习,该方法在不确定性条件下显著提升了调度稳定性和性能,优于贪心策略和基线 DRL 方法,在真实案例研究中表现更优。
This paper focuses on deep reinforcement learning (DRL)-based energy dispatch for isolated microgrids (MGs) with diesel generators (DGs), photovoltaic (PV) panels, and a battery. A finite-horizon Partial Observable Markov Decision Process (POMDP) model is formulated and solved by learning from historical data to capture the uncertainty in future electricity consumption and renewable power generation. In order to deal with the instability problem of DRL algorithms and unique characteristics of finite-horizon models, two novel DRL algorithms, namely, FH-DDPG and FH-RDPG, are proposed to derive energy dispatch policies with and without fully observable state information. A case study using real isolated microgrid data is performed, where the performance of the proposed algorithms are compared with the myopic algorithm as well as other baseline DRL algorithms. Moreover, the impact of uncertainties on MG performance is decoupled into two levels and evaluated respectively.
研究动机与目标
- 解决高比例可再生能源渗透和负荷波动的孤立微电网中动态电能调度的挑战。
- 应对在微电网运行中常见的有限时域、部分可观测环境中深度强化学习的不稳定性问题。
- 开发专门的 DRL 算法,以处理可再生能源发电和负荷需求中的不确定性,同时优化运行成本和可靠性。
- 通过将不确定性分解为不同层次,系统性地分析其对微电网性能的影响。
- 利用真实孤立微电网数据,证明所提算法相较于贪心策略和标准 DRL 基线方法的优越性能。
提出的方法
- 将电能调度问题建模为有限时域部分可观测马尔可夫决策过程(POMDP),以表征未来负荷和可再生能源发电中的不确定性。
- 提出 FH-DDPG,一种专为有限时域任务设计的深度确定性策略梯度变体,具有完全可观测状态,提升了训练稳定性。
- 提出 FH-RDPG,一种新型 DRL 算法,专为部分可观测环境设计,可在无法获取完整状态信息时实现有效的策略学习。
- 使用历史微电网数据训练算法,学习最优调度策略,以最小化运行成本并确保系统稳定性。
- 将不确定性的影晌分解为两个独立层次——负荷不确定性和可再生能源发电不确定性——以分别评估和分析。
- 通过真实孤立微电网数据实施案例研究,将所提算法与贪心策略和标准 DRL 基线方法进行对比验证。
实验结果
研究问题
- RQ1如何有效将深度强化学习应用于具有不确定可再生能源发电和负荷的孤立微电网动态电能调度?
- RQ2在有限时域、部分可观测的微电网调度问题中,标准 DRL 算法面临哪些关键挑战,如何加以缓解?
- RQ3所提出的 FH-DDPG 和 FH-RDPG 算法相较于贪心策略和基线 DRL 方法,在调度稳定性和性能方面提升程度如何?
- RQ4负荷和可再生能源发电的不确定性分别如何影响微电网运行性能?这些影响是否可以解耦并量化?
- RQ5在无法获取完整状态信息的不完全可观测条件下,所提算法是否能保持鲁棒性能?
主要发现
- 与贪心算法和标准 DRL 基线相比,所提出的 FH-DDPG 和 FH-RDPG 算法在调度稳定性和运行成本方面均有显著提升。
- FH-RDPG 在部分可观测条件下表现出色,证明即使在缺乏完整状态信息时仍具有效性。
- 案例研究显示,可再生能源发电和负荷的不确定性对微电网性能具有可测量且独立的影响,可被解耦并分别分析。
- 有限时域建模通过聚焦于短期、可操作的决策窗口,提升了学习效率和策略质量。
- 所提算法在高不确定性条件下实现了更低的累积成本和更高的电能调度可靠性。
- 实证结果证实,从历史数据中学习使算法能很好地泛化到未见场景,从而在真实微电网运行中提升了鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。