Skip to main content
QUICK REVIEW

[论文解读] Two-stage Deep Reinforcement Learning for Inverter-based Volt-VAR Control in Active Distribution Networks

Haotian Liu, Wenchuan Wu|arXiv (Cornell University)|May 20, 2020
Optimal Power Flow Distribution参考文献 33被引用 6
一句话总结

该论文提出了一种两阶段深度强化学习(DRL)框架,用于在模型参数不准确的主动配电网(ADNs)中实现基于逆变器的Volt-VAR控制。该方法在离线阶段采用一种新颖的联合对抗性软演员-critic(JASAC)算法,以提升对模型失配的鲁棒性,随后将训练好的智能体迁移至在线阶段,利用SAC算法实现安全、高效的实时控制,在IEEE 33-和69-bus系统中,其安全性与性能显著优于基线DRL方法。

ABSTRACT

Model-based Vol/VAR optimization method is widely used to eliminate voltage violations and reduce network losses. However, the parameters of active distribution networks(ADNs) are not onsite identified, so significant errors may be involved in the model and make the model-based method infeasible. To cope with this critical issue, we propose a novel two-stage deep reinforcement learning (DRL) method to improve the voltage profile by regulating inverter-based energy resources, which consists of offline stage and online stage. In the offline stage, a highly efficient adversarial reinforcement learning algorithm is developed to train an offline agent robust to the model mismatch. In the sequential online stage, we transfer the offline agent safely as the online agent to perform continuous learning and controlling online with significantly improved safety and efficiency. Numerical simulations on IEEE test cases not only demonstrate that the proposed adversarial reinforcement learning algorithm outperforms the state-of-art algorithm, but also show that our proposed two-stage method achieves much better performance than the existing DRL based methods in the online application.

研究动机与目标

  • 解决主动配电网(ADNs)中因理论网络参数导致的模型失配问题,该问题在基于模型的Volt-VAR控制中引发显著误差。
  • 通过引入两阶段学习框架,将离线鲁棒训练与在线部署分离,克服仅在线DRL训练带来的高风险与低效问题。
  • 通过将知识丰富、对抗性训练的离线智能体迁移至在线环境,提升在线Volt-VAR控制的安全性与效率。
  • 提出一种联合对抗性软演员-critic(JASAC)算法,在离线训练期间显式建模并缓解建模误差的影响,以减小迁移差距。
  • 在真实适用的场景中,基于真实ADN模型,证明所提方法在主动功率损耗与电压调节(VR)性能方面优于最先进的DRL与优化方法。

提出的方法

  • 在在线阶段将Volt-VAR控制问题建模为马尔可夫决策过程(MDP),以支持无功功率调节的序列决策。
  • 在离线训练中使用理论(未校准)网络参数构建近似ADN模型,以模拟现实世界中的不确定性。
  • 提出一种联合对抗性软演员-critic(JASAC)算法,将模型失配视为对抗性MDP(AMDP)框架中的对抗性扰动。
  • 在离线阶段同时训练主角智能体(OFF-A)与对抗智能体,其中对抗智能体模拟最坏情况的建模误差,以提升主角智能体的鲁棒性。
  • 利用主角与对抗智能体之间的共享信息,加速对抗环境下的收敛并提升训练效率。
  • 将预训练的离线智能体(OFF-A)迁移至在线阶段,作为在线智能体(ON-A)的初始策略,后者随后使用软演员-critic(SAC)算法进行连续在线学习。

实验结果

研究问题

  • RQ1两阶段DRL框架能否在模型失配条件下有效缩小离线训练与在线部署之间的性能差距?
  • RQ2所提出的联合对抗性软演员-critic(JASAC)算法是否显著提升离线智能体对建模误差的鲁棒性,相较于标准DRL基线方法?
  • RQ3将预训练的、对抗性鲁棒的离线智能体迁移至在线环境,能在多大程度上提升Volt-VAR控制的安全性与收敛速度?
  • RQ4在主动功率损耗与电压调节(VR)性能方面,所提两阶段方法相较于最先进的DRL与优化方法表现如何?
  • RQ5与现有对抗性DRL方法相比,JASAC算法在离线阶段是否具备更优的收敛性与训练稳定性?

主要发现

  • 所提两阶段DRL方法显著提升了在线控制性能:在IEEE 33-bus系统中,JASAC将初始阶段的有功功率损耗增量从SAC基线的1.74 MW降低至0.437 MW,最大值阶段从1.76 MW降至0.502 MW。
  • 在33-bus系统中,JASAC相比SAC将电压调节(VR)误差降低了近40%,初始阶段均值VR达1.10×10⁻³,最大值阶段为1.39×10⁻³。
  • 在69-bus系统中,JASAC初始阶段的平均有功功率损耗增量仅为0.0675 MW,优于SAC(0.137 MW)与preSAC(0.036 MW),VR降低至7.16×10⁻⁵。
  • 离线阶段的JASAC算法相比基准对抗性DRL算法展现出更优的收敛性与训练效率,实现了更快、更稳定的离线训练。
  • 将离线智能体(OFF-A)迁移至在线阶段显著加速了在线学习,使在线智能体(ON-A)从一开始就可采取高质量动作,降低风险与成本。
  • 所提方法在性能上更接近理想最优解(使用完美模型),在33-bus系统中,JASAC在初始阶段的损耗增量仅比最优值高4.37%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。