Skip to main content
QUICK REVIEW

[論文レビュー] Learning and Fast Adaptation for Grid Emergency Control via Deep Meta Reinforcement Learning

Renke Huang, Yujiao Chen|arXiv (Cornell University)|Jan 13, 2021
Power System Optimization and Stability被引用数 5
ひとこと要約

本稿では、未確認の運用条件やシステムパラメータに適応可能な電力系統の緊急制御方策の高速適応を可能にする、深層メタ強化学習(DMRL)フレームワークを提案する。メタ戦略最適化と並列拡張ランダムサーチ(PARS)アルゴリズムを統合することで、メタトレーニング中に学習された潜在的文脈空間を用い、15分未塔で制御方策の適応が可能となり、標準的なDRLを上回り、MPCと同等の性能を発揮しながら、リアルタイム制御意思決定を可能にする。

ABSTRACT

As power systems are undergoing a significant transformation with more uncertainties, less inertia and closer to operation limits, there is increasing risk of large outages. Thus, there is an imperative need to enhance grid emergency control to maintain system reliability and security. Towards this end, great progress has been made in developing deep reinforcement learning (DRL) based grid control solutions in recent years. However, existing DRL-based solutions have two main limitations: 1) they cannot handle well with a wide range of grid operation conditions, system parameters, and contingencies; 2) they generally lack the ability to fast adapt to new grid operation conditions, system parameters, and contingencies, limiting their applicability for real-world applications. In this paper, we mitigate these limitations by developing a novel deep meta reinforcement learning (DMRL) algorithm. The DMRL combines the meta strategy optimization together with DRL, and trains policies modulated by a latent space that can quickly adapt to new scenarios. We test the developed DMRL algorithm on the IEEE 300-bus system. We demonstrate fast adaptation of the meta-trained DRL polices with latent variables to new operating conditions and scenarios using the proposed method and achieve superior performance compared to the state-of-the-art DRL and model predictive control (MPC) methods.

研究の動機と目的

  • 変化するグリッド条件下で、深層強化学習(DRL)エージェントの迅速な適応が不足している問題に対処する。
  • 顕著に異なる運用条件やシステムパラメータに一般化できない既存のDRL手法の限界を克服する。
  • 電圧安定性と負荷遮断を実現するため、メタラーニングとスケーラブルなDRLトレーニングを組み合わせ、リアルタイムで信頼性の高い緊急制御を可能にする。
  • メタトレーニングされた方策が、再訓練なしに未確認の事故状況、システムパラメータ、潮流条件に迅速に適応できることを実証する。
  • モデル予測制御(MPC)と同等の性能を達成しながら、計算遅延を低減し、リアルタイム運用要件を満たす。

提案手法

  • メタ戦略最適化(MSO)と並列拡張ランダムサーチ(PARS)アルゴリズムを統合し、多様なグリッドシナリオに一般化可能なメタポリシーを学習する。
  • 制御ポリシーの条件付けに潜在的空間表現を用い、メタトレーニング中に学習された文脈ベクトルにより、新しい環境への高速適応を可能にする。
  • メタラーニング中に現実世界の不確実性を再現するため、グリッド運用状態、システムパラメータ、事故状況の分布を用いてエージェントをトレーニングする。
  • トレーニングをメタ最適化段階と適応段階に分解する:多様なシナリオでのメタトレーニングの後、数回の環境観測のみで高速適応を実行する。
  • ニューラルネットワーク推論の計算効率を活用し、MPCの高い計算コストとは対照的にリアルタイムの行動選択を実現する。
  • 故障に起因する遅延電圧回復(FIDVR)イベントに対する是正制御として、IEEE 300バス系統に本手法を適用し、負荷遮断を実施する。

実験結果

リサーチクエスチョン

  • RQ1再訓練なしに、未確認のグリッド運用状態やシステムパラメータに迅速に適応できる深層強化学習エージェントをトレーニング可能か?
  • RQ2メタラーニングされたDRLポリシーの性能は、標準的なDRLおよびモデル予測制御(MPC)と比較して、電圧回復および負荷遮断効率の面でどう異なるか?
  • RQ3提案されたDMRLフレームワークは、制御効果を維持または向上させながら、適応時間をどの程度短縮できるか?
  • RQ4潜在的文脈空間は、標準的なDRLと比較して、多様な事故状況やシステムパラメータへの一般化性を向上させるか?
  • RQ5MPCが遅すぎて不適切な緊急状況において、DMRLフレームワークはリアルタイム制御意思決定を達成できるか?

主な発見

  • DMRL手法は、15分未塔で新たなグリッド状態への適応を達成し、再訓練からのスタートに比べて適応時間を顕著に短縮した。
  • テストシナリオの94.69%において、DMRLは標準的なPARS DRL手法を上回り、多様な運用条件下で報酬差がDMRLに有利に働くことを示した。
  • DMRLは、PARSが失敗した88件のシナリオで電圧安定性を回復させ、特に深刻な影響を持つ未確認の故障状況で顕著な効果を示した。
  • 三相故障イベントにおいて、DMRLベースの制御器は総報酬-2715を達成し、PARS(-25833)を上回り、MPC(-2742)と同等の性能を示した。
  • テスト中、DMRLの推論時間は1秒未塔で、MPCは63.31秒を要し、リアルタイム実行の可能性を示した。
  • DMRLは、PARSに比べて負荷遮断量を10%削減しながら、MPCの最適遮断レベルを同等に維持し、制御効率の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。