Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Power System Emergency Control using Deep Reinforcement Learning

Qiuhua Huang, Renke Huang|arXiv (Cornell University)|Mar 9, 2019
Power System Optimization and Stability参考文献 32被引用数 17
ひとこと要約

本稿では、高次元のシステム状態からのエンド・ツー・エンド学習を用いて、撹乱に動的に対応できる、深層強化学習(DRL)に基づく電力系統用の適応型緊急制御を提案する。オープンソースのRLGCプラットフォームを導入し、2つのテストシステムにおいて、モデルの不確実性や観測ノイズが存在する状況でも、従来手法を上回る頑健性と適応性を示した。

ABSTRACT

Power system emergency control is generally regarded as the last safety net for grid security and resiliency. Existing emergency control schemes are usually designed off-line based on either the conceived "worst" case scenario or a few typical operation scenarios. These schemes are facing significant adaptiveness and robustness issues as increasing uncertainties and variations occur in modern electrical grids. To address these challenges, for the first time, this paper developed novel adaptive emergency control schemes using deep reinforcement learning (DRL), by leveraging the high-dimensional feature extraction and non-linear generalization capabilities of DRL for complex power systems. Furthermore, an open-source platform named RLGC has been designed for the first time to assist the development and benchmarking of DRL algorithms for power system control. Details of the platform and DRL-based emergency control schemes for generator dynamic braking and under-voltage load shedding are presented. Extensive case studies performed in both two-area four-machine system and IEEE 39-Bus system have demonstrated the excellent performance and robustness of the proposed schemes.

研究の動機と目的

  • 高不確実性および高変動性を特徴とする現代の電力系統において、固定かつ事前計算された緊急制御方式の限界を是正すること。
  • 深層強化学習を用いて、システム状態に応じて動的に応答する、適応的でリアルタイムな緊急制御戦略を開発すること。
  • DRLを用いた電力系統制御分野の研究を加速するためのオープンソースのベンチマークプラットフォーム(RLGC)を構築すること。
  • DRLに基づく制御方式が、新たなシナリオ、モデルパラメータの不確実性、観測ノイズに対してどの程度頑健であるかを実証すること。
  • Q学習、MPC、リレー制御などの従来手法に比べ、適応性および性能の面で優れた結果を得ること。

提案手法

  • 過渡安定性および電圧回復を目的とした、状態、行動、報酬関数を最適化したマーカフ連鎖意思決定問題(MDP)として電力系統緊急制御を定式化する。
  • 高次元のシステム状態からエンド・ツー・エンド学習を実行するため、ディープQネットワーク(DQN)およびプロキシマルポリシー最適化(PPO)アルゴリズムを採用する。
  • 標準的なしきい値を超える電圧回復を最優先としつつ、負荷遮断を最小限に抑えるようにカスタム報酬関数を設計する。
  • 2エリア4機械系およびIEEE 39バス系を用いて、シミュレーテッド環境でDRLエージェントを学習させる。
  • 運用制限の違反を防ぐために、報酬関数にペナルティ項を統合し、安全制約を組み込む。
  • DRLアルゴリズムのトレーニング、テスト、ベンチマークを支援するオープンソースのRLGCプラットフォームを開発する。

実験結果

リサーチクエスチョン

  • RQ1DRLに基づく緊急制御は、学習時に見未曾なシステム障害および運用条件に効果的に適応できるか?
  • RQ2電圧回復および負荷遮断性能の観点から、DRLベースの制御は従来手法(例:UVLSリレー、MPC)と比較してどの程度優れているか?
  • RQ3DRLポリシーは、モデルパラメータの不確実性およびノイズの多い状態観測に対してどの程度頑健か?
  • RQ4再トレーニングなしで、DRLエージェントは異なる障害シナリオに一般化できるか?
  • RQ5RLGCプラットフォームは、電力系統制御分野におけるDRLアルゴリズムの再現可能で比較可能なベンチマークをどのように可能にするか?

主な発見

  • DRLベースの緊急制御方式は、平均0.13秒というより速い応答時間を達成し、リアルタイム応用が可能であることが確認された。
  • IEEE 39バス系において、10%のパラメータ不確実性および観測ノイズに対しても、DRL手法は安定した電圧回復を維持し、優れた頑健性を示した。
  • DRL制御下での電圧回復プロファイルは、基準を満たすか、それを上回ったが、MPCやUVLSリレー手法と比較して、はるかに少ない負荷を遮断した。
  • トレーニング時に未確認の障害シナリオに対しても、DRLポリシーは良好な一般化能力を示した。
  • RLGCプラットフォームは、DRLエージェントの一貫性あるトレーニングとベンチマークを成功裏に実現し、再現可能性の向上と今後の研究の加速を支援した。
  • 従来のQ学習と比較して、DRLアプローチは高次元特徴の自動抽出および非線形一般化の利点を活かし、顕著に優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。