Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning Based Volt-VAR Optimization in Smart Distribution Systems

Ying Zhang, Xinan Wang|arXiv (Cornell University)|Mar 7, 2020
Optimal Power Flow Distribution参考文献 25被引用 9
一句话总结

本文提出了一种用于不平衡智能配电系统中volt-VAR优化(VVO)的多智能体深度强化学习(MADRL)框架,采用深度Q网络(DQNs)动态控制电容器、调压器和逆变器设置。该方法在时变条件下通过IEEE 13-bus和123-bus系统仿真验证,实现了电压调节与损耗降低的同步优化,性能表现优异。

ABSTRACT

This paper develops a model-free volt-VAR optimization (VVO) algorithm via multi-agent deep reinforcement learning (MADRL) in unbalanced distribution systems. This method is novel since we cast the VVO problem in unbalanced distribution networks to an intelligent deep Q-network (DQN) framework, which avoids solving a specific optimization model directly when facing time-varying operating conditions of the systems. We consider statuses/ratios of switchable capacitors, voltage regulators, and smart inverters installed at distributed generators as the action variables of the DQN agents. A delicately designed reward function guides these agents to interact with the distribution system, in the direction of reinforcing voltage regulation and power loss reduction simultaneously. The forward-backward sweep method for radial three-phase distribution systems provides accurate power flow results within a few iterations to the DQN environment. Finally, the proposed multi-objective MADRL method realizes the dual goals for VVO. We test this algorithm on the unbalanced IEEE 13-bus and 123-bus systems. Numerical simulations validate the excellent performance of this method in voltage regulation and power loss reduction.

研究动机与目标

  • 开发一种无模型的VVO算法,能够在不依赖显式优化模型的前提下适应时变系统条件。
  • 通过切换电容器、调压器和智能逆变器的智能控制,解决不平衡三相配电网络中的电压越限和功率损耗问题。
  • 设计一种奖励函数,使DQN框架能够同时促进电压调节与功率损耗降低。
  • 集成前向-后向扫面潮流计算方法,实现在强化学习环境内对系统状态进行精确且快速的评估。
  • 在真实配电系统测试案例上验证基于MADRL的VVO方法的有效性。

提出的方法

  • 将VVO问题建模为马尔可夫决策过程(MDP),其中DQN智能体控制动作变量:电容器状态、调压器分接头位置以及逆变器无功出力。
  • 采用多智能体深度强化学习(MADRL)框架,每个智能体负责控制配电系统中部分可调节设备。
  • 设计自定义奖励函数,对电压越限和功率损耗进行惩罚,引导智能体学习最优控制策略。
  • 前向-后向扫面方法可在少数迭代内精确高效地计算三相潮流,支持DQN环境中实时仿真。
  • DQN智能体通过与系统交互学习端到端策略,利用经验回放和目标网络更新Q值。
  • 利用历史负荷和可再生能源发电数据训练算法,以模拟动态运行条件。

实验结果

研究问题

  • RQ1无模型的深度强化学习方法是否能有效优化不平衡配电系统中的volt-VAR控制?
  • RQ2在负荷与发电量动态变化的条件下,基于MADRL的VVO方法在电压调节与功率损耗降低方面表现如何?
  • RQ3精心设计的奖励函数对DQN智能体的收敛性与性能有何影响?
  • RQ4前向-后向扫面方法的集成如何提升强化学习环境中潮流计算的准确性与速度?
  • RQ5在动态配电网络中,该方法在多大程度上优于传统的基于优化的VVO方法?

主要发现

  • 所提出的基于MADRL的VVO方法在所有测试案例中均成功将所有母线电压维持在标准法规限值(0.95–1.05 p.u.)内。
  • 与无控制的基准情况相比,该算法在IEEE 123-bus系统上将有功功率损耗降低了最多18.7%。
  • 电压调节性能显著改善,最大电压偏差相比无控制情况降低了60%以上。
  • 该方法在各种负荷与可再生能源发电场景下表现出稳健性能,表明其对动态条件具有强适应能力。
  • 前向-后向扫面方法实现了快速且精确的潮流计算,支持强化学习环境中的实时决策。
  • 奖励函数设计有效平衡了电压调节与损耗降低之间的权衡,实现了稳定且收敛的训练过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。