[论文解读] Reinforcement Learning for Optimal Frequency Control: A Lyapunov Approach
本文提出了一种李雅普诺夫约束强化学习框架,用于设计基于循环神经网络的稳定非线性频率控制器。通过将李雅普诺夫函数嵌入控制器架构中,该方法实现了设计即稳定(stability by design),并仅使用本地测量数据,在性能上优于线性下垂控制和最先进的强化学习方法。
The increase in penetration of inverter-based resources provides us with more flexibility in frequency regulation compared to conventional linear droop controllers. Using their power electronic interfaces, inverter-based resources can realize almost arbitrary responses to frequency changes. Reinforcement learning (RL) has emerged as a popular method to design these nonlinear controllers to optimize a host of objective functions. The key challenge with RL-based approaches is how to enforce the constraint that the learned controller should be stabilizing. In addition, training these controllers is nontrivial because of the time-coupled dynamics of power systems. In this paper, we propose to explicitly engineer the structure of neural network-based controllers such that they guarantee system stability by design. This is done by constraining the network structures using a well-known Lyapunov function. A recurrent RL architecture is used to efficiently train the controllers. The resulting controllers only use local information and outperform linear droop as well as controllers trained using existing state-of-the-art learning approaches.
研究动机与目标
- 为解决在高逆变器渗透率电力系统中,基于强化学习的频率控制器确保稳定性的挑战。
- 克服由于电力系统中时间耦合动力学导致训练强化学习控制器的困难。
- 设计一种控制器,保证系统稳定性,而无需依赖事后验证或大量超参数调优。
- 开发一种仅使用本地测量数据的方法,同时在性能上优于传统线性下垂控制和现有基于强化学习的控制器。
- 通过具有内在稳定性的神经网络结构,实现非线性、自适应的控制响应。
提出的方法
- 控制器设计为循环神经网络,以捕捉时间动态并实现在频率调节中的长期规划。
- 将李雅普诺夫函数显式嵌入神经网络架构中,以在训练过程中施加稳定性约束。
- 约束网络结构,使得李雅普诺夫函数的导数为负半定,从而确保渐近稳定性。
- 通过强化学习训练策略,使用优化频率调节目标(如调节时间和超调量)的奖励函数。
- 该方法仅使用本地频率测量,使其在配电网层级的逆变器资源中具有可扩展性和实用性。
- 训练过程通过循环连接实现时间信用分配,提高了时间耦合系统中的样本效率。
实验结果
研究问题
- RQ1是否可以设计一种基于强化学习的控制器,确保系统稳定性,而无需依赖外部稳定性检查?
- RQ2如何将李雅普诺夫理论集成到深度强化学习架构中,以实现设计即稳定?
- RQ3在仅使用本地信息的情况下,基于循环神经网络的强化学习控制器在频率调节中,相较于线性下垂控制和现有强化学习方法,性能提升程度如何?
- RQ4所提出方法在训练和运行过程中如何处理电力系统动力学的时间耦合特性?
- RQ5将李雅普诺夫函数嵌入神经网络结构对控制器性能和收敛性有何影响?
主要发现
- 通过在神经网络架构中显式嵌入李雅普诺夫函数,所提出的控制器实现了设计即稳定,保证了系统稳定性。
- 循环强化学习架构能够有效学习时间耦合动力学,在暂态频率事件中显著提升控制器性能。
- 在各种扰动场景下,该控制器在频率偏差、调节时间和超调量方面均优于线性下垂控制器。
- 与最先进的基于强化学习的控制器相比,该方法在处理非线性响应和维持稳定性方面表现更优。
- 控制器仅依赖本地频率测量运行,支持在配电网中实现去中心化部署。
- 引入李雅普诺夫约束显著提升了训练稳定性与收敛性,相较于无约束的强化学习方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。