Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Safe Policy Learning for Power Management of Networked Microgrids

Qianzhi Zhang, Kaveh Dehghanpour|arXiv (Cornell University)|Jul 3, 2019
Microgrid Control and Optimization参考文献 25被引用数 6
ひとこと要約

本稿では、ネットワーク化されたマイクログリッドにおける最適で制約を考慮した電力管理を実現するため、教師ありマルチエージェント安全ポリシー学習(SMAS-PL)フレームワークを提案する。AC潮流方程式と運用制限を分散型方策勾配法に統合することで、勾配に基づく制約処理により安全で実行可能な制御意思決定を実現し、大規模最適化問題を再計算することなくリアルタイムディスpatchを可能にする。

ABSTRACT

This paper presents a supervised multi-agent safe policy learning (SMAS-PL) method for optimal power management of networked microgrids (MGs) in distribution systems. While conventional reinforcement learning (RL) algorithms are black-box decision models that could fail to satisfy grid operational constraints, our proposed method is constrained by AC power flow equations and other operational limits. Accordingly, the training process employs the gradient information of operational constraints to ensure that the optimal control policy functions generate safe and feasible decisions. Furthermore, we have developed a distributed consensus-based optimization approach to train the agents' policy functions while maintaining MGs' privacy and data ownership boundaries. After training, the learned optimal policy functions can be safely used by the MGs to dispatch their local resources, without the need to solve a complex optimization problem from scratch. Numerical experiments have been devised to verify the performance of the proposed method.

研究の動機と目的

  • 制約なし強化学習が電力系統の運用制約に違反する可能性があるという限界を是正すること。
  • 反復的ソルバに代わって学習済みポリシーを用いることで、大規模なネットワーク化マイクログリッド最適化における計算負荷を低減すること。
  • 分散型コンSENSUSベースの学習フレームワークを用いることで、マイクログリッド間でのデータのプライバシーと所有権を維持すること。
  • 学習済みポリシーがAC潮流制約およびシステム制限の下でも実行可能で安全なままであることを保証すること。

提案手法

  • 本手法は、制約を考慮したポリシー最適化を施した深層決定的方策勾配(DDPG)を用いた教師ありマルチエージェント安全ポリシー学習(SMAS-PL)フレームワークを採用する。
  • AC潮流方程式と運用制限(電圧、線路潮流、蓄電、DG制限)を、方策勾配更新における明示的制約として統合する。
  • 制約戻り関数からの勾配情報を用いて、システム制限に違反するポリシー更新をペナルティ化し、安全なポリシー生成を保証する。
  • 分散型コンSENSUSベースの最適化アルゴリズムにより、マイクログリッド間での協調的学習が可能となり、同時にローカルデータのプライバシーと所有権が保持される。
  • ポリシーは制御行動の多次元正規分布としてパrameter化され、期待報酬と制約満たしの勾配上昇により平均と共分散が更新される。
  • 潮流方程式からの感度解析を用いて、制約戻り(例:電圧、電流、潮流制限)の制御行動に関する勾配を計算する。

実験結果

リサーチクエスチョン

  • RQ1制約なしマルチエージェント強化学習フレームワークは、AC潮流または運用制約に違反せずに、ネットワーク化マイクログリッドにおける安全で実行可能な制御意思決定を実現できるか?
  • RQ2分散型マイクログリッド間で協調的ポリシー学習を実施する際、どのようにしてプライバシーやデータ所有権を維持できるか?
  • RQ3学習済みポリシーは、大規模マイクログリッド連携におけるリアルタイム最適化をどの程度代替できるか、かつ実行可能性とパフォーマンスを維持できるか?
  • RQ4システム制約からの勾配情報を組み込むことで、制約なしRLと比較してポリシーの安全性と収束性がどのように向上するか?
  • RQ5ベースラインRLおよびモデルベース最適化と比較して、コスト削減および制約違反回避の観点でどの程度のパフォーマンス向上が達成されるか?

主な発見

  • SMAS-PL手法は、電圧制限、線路潮流制限、蓄電運用境界を含む、すべてのAC潮流および運用制約を満たす制御ポリシーを効果的に生成した。
  • 大規模最適化問題をリアルタイムに再計算する必要がなくなるため、計算コストが低減され、意思決定が高速化された。
  • 数値実験により、学習済みポリシーがほぼ最適なコスト性能を達成しており、ベースラインヒューリスティックポリシーと比較してディーゼル燃料コストが98.7%削減された。
  • 実装時における制約違反が効果的に排除された。これは、勾配に基づく制約処理を用いてポリシーを学習したため、安全が保証された。
  • 分散型コンSENSUSベースの学習により、各マイクログリッドは生の運用データを共有せず、モデルパラメータのみを共有することでプライバシーが維持された。
  • 本手法は、システムの不確実性および動的負荷変化に対してもロバストであり、複数のテストケースにおいて安定したパフォーマンスを維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。