Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Optimal Frequency Control: A Lyapunov Approach

Wenqi Cui, Baosen Zhang|arXiv (Cornell University)|Sep 11, 2020
Microgrid Control and Optimization参考文献 64被引用数 9
ひとこと要約

本稿では、再帰的ニューラルネットワークを用いて、安定性を保証する非線形周波数制御の設計を目的とした、リャプノフ制約付き強化学習フレームワークを提案する。制御器のアーキテクチャにリャプノフ関数を埋め込むことで、設計段階から安定性を保証し、局所測定情報のみを用いても、線形ドロープ法や最先端の強化学習手法を上回る優れた性能を達成する。

ABSTRACT

The increase in penetration of inverter-based resources provides us with more flexibility in frequency regulation compared to conventional linear droop controllers. Using their power electronic interfaces, inverter-based resources can realize almost arbitrary responses to frequency changes. Reinforcement learning (RL) has emerged as a popular method to design these nonlinear controllers to optimize a host of objective functions. The key challenge with RL-based approaches is how to enforce the constraint that the learned controller should be stabilizing. In addition, training these controllers is nontrivial because of the time-coupled dynamics of power systems. In this paper, we propose to explicitly engineer the structure of neural network-based controllers such that they guarantee system stability by design. This is done by constraining the network structures using a well-known Lyapunov function. A recurrent RL architecture is used to efficiently train the controllers. The resulting controllers only use local information and outperform linear droop as well as controllers trained using existing state-of-the-art learning approaches.

研究の動機と目的

  • インバータの浸透率の高い電力システムにおける、強化学習ベースの周波数制御の安定性を保証する課題に取り組む。
  • 電力システムにおける時間的結合ダイナミクスのため、RL制御の学習が困難になる問題を克服する。
  • 事後的安定性検証や膨大なハイパーパrameterチューニングに依存せずに、システムの安定性を保証する制御器を設計する。
  • 従来の線形ドロープ法や既存のRLベースの手法を上回りつつ、局所測定情報のみを用いる方法を開発する。
  • 神経ネットワーク構造を用いて非線形的・適応的制御応答を実現し、本質的に安定性を保証する制御器を設計する

提案手法

  • 周波数制御における時間的ダイナミクスを捉え、長期的計画を可能にするために、制御器を再帰的ニューラルネットワークとして設計する。
  • 訓練中に安定性制約を強制するために、リャプノフ関数をニューラルネットワークのアーキテクチャに明示的に埋め込む。
  • ネットワーク構造を制約することで、リャプノフ関数の微分が負半定値となるようにし、漸近的安定性を保証する。
  • 周波数制御の目的(定常時間、オーバーシュートなど)を最適化する報酬関数を用いて、強化学習によりポリシーを訓練する。
  • 局所周波数測定情報のみを用いるため、配電網レベルのインバータベースリソースにスケーラブルかつ実用的である。
  • 再帰的接続による時間的信用配分を活用することで、時間的結合系におけるサンプル効率を向上させる

実験結果

リサーチクエスチョン

  • RQ1外部の安定性チェックに依存せずに、システム安定性を保証する強化学習ベースの制御器を設計できるか?
  • RQ2リャプノフ理論を深層強化学習アーキテクチャに統合することで、設計段階から安定性を保証する方法は何か?
  • RQ3局所情報のみを用いる再帰的RL制御器は、線形ドロープ法や既存のRL手法に比べて、周波数制御においてどの程度優れた性能を発揮するか?
  • RQ4本手法は、学習および運用の両段階で、電力システムダイナミクスの時間的結合性をどのように処理するか?
  • RQ5ニューラルネットワーク構造にリャプノフ関数を埋め込むことで、制御器の性能および収束性にどのような影響を与えるか?

主な発見

  • 提案された制御器は、ニューラルネットワークアーキテクチャにリャプノフ関数を明示的に埋め込むことで、設計段階からシステム安定性を保証する。
  • 再帰的RLアーキテクチャにより、時間的結合ダイナミクスの有効な学習が可能となり、過渡周波数イベントにおける制御性能が向上する。
  • さまざまな擾乱シナリオ下で、周波数偏差、定常時間、オーバーシュートの観点から、線形ドロープ制御器を上回る性能を発揮する。
  • 特に非線形応答の処理や安定性の維持において、最先端のRLベースの制御器を上回る性能を達成する。
  • 局所周波数測定情報のみを用いるため、配電網における分散型展開が可能である。
  • リャプノフ制約の導入により、制約なしのRLアプローチに比べて、訓練の安定性および収束性が著しく向上する

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。