Skip to main content
QUICK REVIEW

[论文解读] Dynamic Energy Dispatch Based on Deep Reinforcement Learning in IoT-Driven Smart Isolated Microgrids

Lei Lei, Yue Tan|arXiv (Cornell University)|Feb 7, 2020
Smart Grid Energy Management参考文献 45被引用 8
一句话总结

本文提出有限时域深度强化学习算法 FH-DDPG 与 FH-RDPG,用于在具有柴油发电机、光伏发电和电池的物联网驱动孤立微电网中实现动态电力调度。通过将问题建模为有限时域部分可观测马尔可夫决策过程(POMDP),该方法在基线深度强化学习(DRL)与模型预测控制(MPC)方法之上提升了稳定性和性能,利用历史数据更好地处理负荷与光伏发电的不确定性,实现了更低的运行成本。

ABSTRACT

Microgrids (MGs) are small, local power grids that can operate independently from the larger utility grid. Combined with the Internet of Things (IoT), a smart MG can leverage the sensory data and machine learning techniques for intelligent energy management. This paper focuses on deep reinforcement learning (DRL)-based energy dispatch for IoT-driven smart isolated MGs with diesel generators (DGs), photovoltaic (PV) panels, and a battery. A finite-horizon Partial Observable Markov Decision Process (POMDP) model is formulated and solved by learning from historical data to capture the uncertainty in future electricity consumption and renewable power generation. In order to deal with the instability problem of DRL algorithms and unique characteristics of finite-horizon models, two novel DRL algorithms, namely, finite-horizon deep deterministic policy gradient (FH-DDPG) and finite-horizon recurrent deterministic policy gradient (FH-RDPG), are proposed to derive energy dispatch policies with and without fully observable state information. A case study using real isolated MG data is performed, where the performance of the proposed algorithms are compared with the other baseline DRL and non-DRL algorithms. Moreover, the impact of uncertainties on MG performance is decoupled into two levels and evaluated respectively.

研究动机与目标

  • 解决高比例可再生能源渗透以及负荷与发电不确定性的孤立微电网中动态电力调度的挑战。
  • 开发适用于有限时域、部分可观测环境的稳定深度强化学习算法,此类环境在实际微电网运行中普遍存在。
  • 通过最优整合光伏发电与电池储能,最小化柴油发电机的运行成本。
  • 通过解耦分析,评估负荷与光伏发电不确定性对微电网性能的影响。
  • 基于真实世界数据,将所提算法与基线 DRL 及基于模型的 MPC 方法进行对比。

提出的方法

  • 建立有限时域部分可观测马尔可夫决策过程(POMDP)模型,以表征负荷与光伏发电不确定性下的电力调度问题。
  • 提出两种新型深度强化学习算法:有限时域深度确定性策略梯度(FH-DDPG)用于完全可观测状态,有限时域循环神经网络 DDPG(FH-RDPG)用于部分可观测状态。
  • 利用历史负荷与光伏数据训练策略,通过模拟随机系统动态以提升泛化能力与稳定性。
  • 在 FH-RDPG 中采用长短期记忆网络(LSTM)以建模时间依赖性并处理部分可观测性。
  • 采用带迭代线性二次高斯(iLQG)优化的模型预测控制作为对比基准。
  • 使用 2017 年 7 月的真实孤立微电网数据进行性能评估,训练使用 7 天、14 天与 21 天的历史数据窗口,测试使用同日数据。

实验结果

研究问题

  • RQ1有限时域 DRL 算法在孤立微电网动态电力调度中如何提升稳定性和性能?
  • RQ2FH-DDPG 与 FH-RDPG 在运行成本与不确定性下的鲁棒性方面,相较于基线 DDPG 与 RDPG 的提升程度如何?
  • RQ3在历史数据与同日数据上进行训练,对基于 DRL 的调度策略泛化能力与性能有何影响?
  • RQ4负荷与光伏发电不确定性对微电网性能的影响是什么?能否实现定量解耦?
  • RQ5当仅能获取部分状态信息(如电池荷电状态 SoC,而非完整系统状态)时,所提算法能否有效管理电力调度?

主要发现

  • 所提出的 FH-DDPG 与 FH-RDPG 算法在完全可观测与部分可观测条件下,均显著优于基线 DDPG 与 RDPG,有效降低了柴油发电机的运行成本。
  • 在 POMDP 场景下,FH-RDPG 表现出更优性能,证明其在仅依赖有限状态信息时仍具备有效的决策能力,这与实际部署中的典型情况一致。
  • 无论在同日数据还是 7 至 21 天历史数据上进行训练,FH-DDPG 与 FH-RDPG 的性能均保持稳定且一致,表明其具备强大的泛化能力。
  • 所提算法在性能上优于 MPC-iLQG 与 MPC-iLQG-POMDP 基准,尤其在不确定性条件下,凸显了端到端 DRL 相较于基于模型的预测控制的优势。
  • 使用 RNN 进行 PV 与负荷预测的模型误差分别为 2.27×10⁻³ 与 1.39×10⁻³(归一化均方误差),降低这些误差可进一步提升基于 MPC 的方法性能。
  • 本研究通过将不确定性分解为两个层次,量化了其对系统性能的影响,表明基于 DRL 的方法对日前预测误差具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。