Skip to main content
QUICK REVIEW

[論文レビュー] Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks

Yuanqi Gao, Wang Wei|arXiv (Cornell University)|Jul 6, 2020
Optimal Power Flow Distribution参考文献 30被引用数 5
ひとこと要約

本稿では、アクティブな配電網におけるバーレート・バーレート制御のためのコンSENSUSマルチエージェント深層強化学習(C-MARL)アルゴリズムを提案する。この手法は、ネットワークのトポロジー やパrameter の知識に依存せずに、分散型でモデルフリーの制御を可能にする。最大エントロピー強化学習フレームワーク内に、通信効率の高いコンセンサス戦略を採用し、集中型強化学習と同等の性能を達成すると同時に、エージェントや通信障害に対しても耐性を示す。

ABSTRACT

Volt-VAR control (VVC) is a critical application in active distribution network management system to reduce network losses and improve voltage profile. To remove dependency on inaccurate and incomplete network models and enhance resiliency against communication or controller failure, we propose consensus multi-agent deep reinforcement learning algorithm to solve the VVC problem. The VVC problem is formulated as a networked multi-agent Markov decision process, which is solved using the maximum entropy reinforcement learning framework and a novel communication-efficient consensus strategy. The proposed algorithm allows individual agents to learn a group control policy using local rewards. Numerical studies on IEEE distribution test feeders show that our proposed algorithm matches the performance of single-agent reinforcement learning benchmark. In addition, the proposed algorithm is shown to be communication efficient and resilient.

研究の動機と目的

  • 正確なネットワークモデルや集中型調整を必要としない分散型でデータ駆動のバーレート・バーレート制御手法を開発すること。
  • 集中型制御アーキテクチャで一般的な個々のエージェントや通信リンクの障害に対して、システムの耐障害性を高めること。
  • 既存のコンセンサスベースの手法(例:ADMM)と比較して、通信オーバーヘッドを低減しつつ高い制御性能を維持すること。
  • グローバルな状態情報に依存せずに、ローカル報酬と価値関数の整合性を通じてマルチエージェントの協調制御を可能とすること。
  • 実際の故障シナリオ下で標準的なIEEE配電テスト系統を用いて、本手法を検証し、集中型RLベンチマークと比較すること。

提案手法

  • 各エージェントごとにローカル報酬を持つネットワーキングマルチエージェントマークフオフプロセス(MMDP)としてバーレート・バーレート制御問題を定式化する。
  • 探索を促進し、サンプル効率を向上させるために、最大エントロピー強化学習フレームワークを採用する。
  • ランダム化に基づくプロトコルを用いてエージェントの価値関数を整合化する、通信効率の高い新規コンセンサス戦略を導入する。
  • 各エージェントは、グローバル状態価値関数を近似するための深層ニューラルネットワークと、ローカルポリシーを学習するためのもう一つの深層ニューラルネットワークを訓練する。
  • 隣接エージェントの価値関数の類似性を最小化するコンセンサス目的関数を用い、協調学習を可能にする。
  • エージェントがローカル観測と隣接エージェントとの限定的通信に基づいて、自身のポリシーを更新する分散型トレーニングスキームを適用する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェント深層強化学習アプローチは、完全なネットワークモデルを必要とせずに、集中型RLと同等のバーレート・バーレート制御性能を達成できるか?
  • RQ2通信集約型手法(例:ADMM)と比較して、提案されたコンセンサス戦略は通信効率においてどのように優れているか?
  • RQ3実時間運用において、個々のエージェントや通信リンクの障害に対して、提案されたC-MARLアルゴリズムはどの程度耐障害性を示すか?
  • RQ4ローカル報酬の最大化と価値関数コンセンサスを組み合わせることで、分散型バーレート・バーレート制御において効果的なグローバルな協調制御が可能になるか?
  • RQ5分散型エネルギー資源を有するアクティブな配電網に特徴的な高次元状態空間において、本手法は性能を維持できるか?

主な発見

  • 提案されたC-MARLアルゴリズムは、IEEE配電テスト系統において、単一エージェント深層強化学習のベンチマーク性能と同等のバーレート・バーレート制御性能を達成した。
  • エージェント障害および通信リンクの遮断に対しても、長期的な性能に著しい低下を示さず、高い耐障害性を示した。
  • ADMMベースのコンセンサス方式と比較して、通信オーバーヘッドが顕著に低減され、大規模かつリアルタイムでの展開に適している。
  • ネットワークのトポロジー やパrameter の知識に依存せず、運用データとローカル相互作用にのみ依存して動作した。
  • コンセンサス機構により、エージェントの価値関数が効果的に整合化され、通信が限定的であっても協調制御が可能となった。
  • 数値的実験では、部品の故障クリア時間が著しく長くない限り、故障状態においても性能低下がほとんど認められ、動的環境におけるロバストネスを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。