Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Distributed Transient Frequency Control with Stability and Safety Guarantees

Zhenyi Yuan, Changhong Zhao|arXiv (Cornell University)|Jul 7, 2022
Power System Optimization and Stability被引用 5
一句话总结

该论文提出了一种基于强化学习(RL)的电力系统分布式暂态频率控制方法,可同时保证渐近稳定性和暂态频率安全性。通过在李雅普诺夫与安全关键控制框架内引入动态预算分配机制,该方法使稳定性条件更加宽松,从而允许通过强化学习训练神经网络控制器,以最小化频率偏差和控制成本,同时确保在IEEE 39节点测试系统中系统范围内的安全与稳定。

ABSTRACT

This paper proposes a reinforcement learning-based approach for optimal transient frequency control in power systems with stability and safety guarantees. Building on Lyapunov stability theory and safety-critical control, we derive sufficient conditions on the distributed controller design that ensure the stability and transient frequency safety of the closed-loop system. Our idea of distributed dynamic budget assignment makes these conditions less conservative than those in recent literature, so that they can impose less stringent restrictions on the search space of control policies. We construct neural network controllers that parameterize such control policies and use reinforcement learning to train an optimal one. Simulations on the IEEE 39-bus network illustrate the guaranteed stability and safety properties of the controller along with its significantly improved optimality.

研究动机与目标

  • 设计一种用于低惯性电力系统暂态频率调节的分布式控制策略,确保同时具备稳定性与暂态频率安全性。
  • 通过引入分布式动态预算分配机制,降低稳定性与安全性约束的保守性。
  • 利用强化学习训练神经网络控制器,以优化频率偏差与控制成本,同时满足稳定性与安全性约束。
  • 在完整与部分扰动信息条件下,于IEEE 39节点系统上验证该方法的有效性。
  • 通过控制器设计中的利普希茨正则化,提升对测量噪声的鲁棒性。

提出的方法

  • 将暂态频率控制问题建模为一个优化问题,旨在满足稳定性与安全性约束下最小化频率偏差与控制成本。
  • 基于李雅普诺夫稳定性理论与安全关键控制,推导出确保稳定性与暂态安全的充分条件,并以各母线的分布式预算约束形式表达。
  • 提出一种动态预算分配机制,使各母线可在保持系统整体稳定性与安全性的前提下共享扰动负担。
  • 构建具有基于稳定性与安全性条件导出的结构约束的神经网络控制器,以确保策略的可行性。
  • 采用基于循环神经网络(RNN)的强化学习框架训练控制器参数,其奖励函数平衡性能与成本。
  • 在强化学习训练过程中应用利普希茨正则化,以提升对频率测量噪声的鲁棒性。

实验结果

研究问题

  • RQ1能否设计一种分布式强化学习控制器,以确保电力系统中同时具备渐近稳定性和暂态频率安全性?
  • RQ2如何通过分布式预算机制降低稳定性与安全性约束的保守性?
  • RQ3与现有基于RL和控制的方法相比,该方法在成本、收敛速度与暂态性能方面具有多大程度的优越性?
  • RQ4当扰动位置部分已知或未知时,控制器的性能表现如何?
  • RQ5利普希茨正则化是否能提升基于强化学习的控制器对频率测量噪声的鲁棒性?

主要发现

  • 所提出的RLb方法在控制成本为1.1628的情况下,同时保证了渐近稳定性和暂态频率安全性,显著低于文献[5]中2.2054的控制成本。
  • 尽管成本高于[9],RLb方法在收敛速度与暂态频率波动方面优于[5],这得益于其安全约束的强制执行。
  • 动态预算分配机制确保在收敛时各母线的个体预算归零,同时总预算保持为零,从而实现协作调节并降低控制努力。
  • 在部分扰动信息条件下(RLb*),该方法仍保持稳定与安全,控制成本为1.1721,表现出对扰动位置不确定性的鲁棒性。
  • 利普希茨正则化有效降低了测量噪声下的状态与控制信号波动,提升了鲁棒性,且未损害安全性或稳定性。
  • IEEE 39节点系统的仿真结果表明,RLb控制器在实现更优最优性的同时,严格满足了稳定性与安全性保障。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。