Skip to main content
QUICK REVIEW

[論文レビュー] Two-stage Deep Reinforcement Learning for Inverter-based Volt-VAR Control in Active Distribution Networks

Haotian Liu, Wenchuan Wu|arXiv (Cornell University)|May 20, 2020
Optimal Power Flow Distribution参考文献 33被引用数 6
ひとこと要約

本稿では、不正確なモデルパラメータを有するアクティブ配電網(ADN)におけるインバータベースのバーレート・バーレクト制御のための2段階的ディープ強化学習(DRL)フレームワークを提案する。不正確なモデルに対するロバストなエージェントを訓練するための新しい共同敵対的ソフトアクターシステム(JASAC)アルゴリズムをオフライン段階で使用し、その後SACを用いてオンライン段階に移行することで、安全かつ効率的なリアルタイム制御を実現する。IEEE 33-および 69-バス系において、ベースラインDRL手法に比べて安全性と性能の両面で顕著に優れている。

ABSTRACT

Model-based Vol/VAR optimization method is widely used to eliminate voltage violations and reduce network losses. However, the parameters of active distribution networks(ADNs) are not onsite identified, so significant errors may be involved in the model and make the model-based method infeasible. To cope with this critical issue, we propose a novel two-stage deep reinforcement learning (DRL) method to improve the voltage profile by regulating inverter-based energy resources, which consists of offline stage and online stage. In the offline stage, a highly efficient adversarial reinforcement learning algorithm is developed to train an offline agent robust to the model mismatch. In the sequential online stage, we transfer the offline agent safely as the online agent to perform continuous learning and controlling online with significantly improved safety and efficiency. Numerical simulations on IEEE test cases not only demonstrate that the proposed adversarial reinforcement learning algorithm outperforms the state-of-art algorithm, but also show that our proposed two-stage method achieves much better performance than the existing DRL based methods in the online application.

研究の動機と目的

  • 理論的ネットワークパラメータがモデルベースのバーレート・バーレクト制御に顕著な誤差をもたらすアクティブ配電網(ADN)におけるモデル不一致の深刻な課題に対処する。
  • オンライン学習のみに依存する場合の高いリスクと非効率性を解消するため、オフラインでのロバストな学習とオンラインでの展開を分離する2段階学習フレームワークを導入する。
  • オフライン段階で知識豊富で敵対的に訓練されたエージェントをオンライン環境に移行させることで、オンラインバーレート・バーレクト制御の安全性と効率性を向上させる。
  • モデル誤差の影響を明示的にモデル化・低減するため、オフライン学習段階でモデル不一致を敵対的摂動として扱う共同敵対的ソフトアクターシステム(JASAC)アルゴリズムを提案する。
  • 現実的で実用的なADNモデルを用いたシナリオにおいて、最先端のDRLおよび最適化ベース手法と比較して優れたオンライン性能を実証する。

提案手法

  • オンライン段階において、バーレート・バーレクト制御問題をマルコフ決定過程(MDP)として定式化し、無効電力制御のための逐次的意思決定を可能にする。
  • オフライン学習のために、実際の同定されていない理論的(非同定)ネットワークパラメータを用いて近似ADNモデルを構築し、現実世界の不確実性を模擬する。
  • モデル不一致を敵対的摂動として扱う共同敵対的ソフトアクターシステム(JASAC)アルゴリズムを提案し、敵対的MDP(AMDP)フレームワークに統合する。
  • オフライン段階で、プロトコルエージェント(OFF-A)と敵対エージェントを同時に訓練する。敵対エージェントは最悪のモデル誤差を模擬することで、プロトコルエージェントのロバスト性を向上させる。
  • プロトコルエージェントと敵対エージェント間の共有情報を利用することで、敵対的環境下での収束速度と学習効率を向上させる。
  • 事前に訓練済みのオフラインエージェント(OFF-A)をオンライン段階に移行し、オンラインエージェント(ON-A)の初期方策として採用する。その後、SACアルゴリズムを用いて継続的なオンライン学習を実行する。

実験結果

リサーチクエスチョン

  • RQ1モデル不一致下でのADNバーレート・バーレクト制御において、2段階的DRLフレームワークはオフライン学習とオンライン展開の間の性能ギャップを効果的に低減できるか?
  • RQ2提案された共同敵対的ソフトアクターシステム(JASAC)アルゴリズムは、標準的なDRLベースラインと比較して、モデル誤差に対するオフラインエージェントのロバスト性を顕著に向上させるか?
  • RQ3事前に訓練され、敵対的にロバストなオフラインエージェントを移行させることで、オンラインバーレート・バーレクト制御の安全性と収束速度はどの程度向上するか?
  • RQ4提案手法は、最先端のDRLおよび最適化ベース手法と比較して、有効電力損失と電圧制御(VR)性能の両面で優れた性能を示すか?
  • RQ5JASACアルゴリズムは、既存の敵対的DRL手法と比較して、オフライン段階における収束性と学習安定性に優れているか?

主な発見

  • 提案された2段階的DRL手法はオンライン制御性能を顕著に向上させた。IEEE 33-バス系では、JASACは初期段階で有効電力損失増加量をSACベースラインの1.74 MWから0.437 MWにまで低減し、最大時でも1.76 MWから0.502 MWにまで低下させた。
  • 33-バス系において、JASACはSACと比較して電圧制御(VR)誤差をほぼ40%削減し、初期段階で平均VRが1.10×10⁻³、最大時で1.39×10⁻³を達成した。
  • 69-バス系では、JASACは初期段階で平均有効電力損失増加量をわずか0.0675 MWにまで低減し、SAC(0.137 MW)およびpreSAC(0.036 MW)を上回った。VR誤差は7.16×10⁻⁵にまで低下した。
  • オフライン段階におけるJASACアルゴリズムは、ベンチマーク敵対的DRLアルゴリズムと比較して優れた収束性と学習効率を示し、より高速で安定したオフライン学習を可能にした。
  • オフラインエージェント(OFF-A)をオンライン段階に移行させることで、オンライン学習が顕著に加速され、オンラインエージェント(ON-A)は初期段階から高品質な行動を取ることができ、リスクとコストが低減された。
  • 提案手法は、完璧なモデルを使用した理想最適解に最も近い性能を達成し、33-バス系では初期段階で最適損失増加量の4.37%以内に収束した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。