Skip to main content
QUICK REVIEW

[論文レビュー] PowerNet: Multi-agent Deep Reinforcement Learning for Scalable Powergrid Control

Chen Dong, Zhaojian Li|arXiv (Cornell University)|Nov 24, 2020
Microgrid Control and Optimization参考文献 48被引用数 6
ひとこと要約

本稿では、インバータベースのマイクログリッドにおけるスケーラブルな二次電圧制御のための分散型でオンポリシーのマルチエージェント強化学習アルゴリズム、PowerNetを提案する。空間的割引係数、微分可能通信、アクションスムージングを統合することで、最先端のマルチエージェント強化学習手法およびモデルベース制御と比較して、より高速な収束と優れた電圧制御性能を達成し、40バス系において推論時間が36ms未満であることを確認した。

ABSTRACT

This paper develops an efficient multi-agent deep reinforcement learning algorithm for cooperative controls in powergrids. Specifically, we consider the decentralized inverter-based secondary voltage control problem in distributed generators (DGs), which is first formulated as a cooperative multi-agent reinforcement learning (MARL) problem. We then propose a novel on-policy MARL algorithm, PowerNet, in which each agent (DG) learns a control policy based on (sub-)global reward but local states from its neighboring agents. Motivated by the fact that a local control from one agent has limited impact on agents distant from it, we exploit a novel spatial discount factor to reduce the effect from remote agents, to expedite the training process and improve scalability. Furthermore, a differentiable, learning-based communication protocol is employed to foster the collaborations among neighboring agents. In addition, to mitigate the effects of system uncertainty and random noise introduced during on-policy learning, we utilize an action smoothing factor to stabilize the policy execution. To facilitate training and evaluation, we develop PGSim, an efficient, high-fidelity powergrid simulation platform. Experimental results in two microgrid setups show that the developed PowerNet outperforms a conventional model-based control, as well as several state-of-the-art MARL algorithms. The decentralized learning scheme and high sample efficiency also make it viable to large-scale power grids.

研究の動機と目的

  • 分散マイクログリッドにおける集中型およびモデルベースの二次電圧制御のスケーラビリティとロバストネスの課題に対処すること。
  • グローバルなシステムモデルに依存せずに、効率的でスケーラブルな制御を可能にする分散型で協調的なマルチエージェント強化学習(MARL)フレームワークを開発すること。
  • 既存のMARL手法が系統の不確実性、通信オーバーヘッド、大規模送電網へのスケーラビリティの制限を抱える問題を克服すること。
  • 空間的割引と微分可能通信といった新規なアーキテクチャ的要素を通じて、学習効率の向上とポリシーの一般化能力の強化を図ること。
  • 完全な再トレーニングなしに、DGの追加・削除などのトポロジー変更に動的に適応できることで、運用のレジリエンスを高めること。

提案手法

  • 分散型MARLのための協調的部分的に観測可能なマルコフ意思決定過程(POMDP)として、二次電圧制御問題を定式化する。
  • 遠く離れたエージェントの影響を軽減する空間的割引係数を導入し、学習の高速化とスケーラビリティの向上を図る。
  • 隣接エージェント間で符号化されたメッセージを交換できる、微分可能で学習ベースの通信プロトコルを実装し、協調性の向上を図る。
  • オンポリシー学習中のシステムノイズや不確実性下でもポリシー実行を安定化させるため、アクションスムージング要因を適用する。
  • 各分散型発電機(DG)がローカル観測と隣接エージェントから受信したメッセージのみを用いてポリシーを学習する分散型でオンポリシーの学習スキームを設計する。
  • MARLポリシーのリアルな学習と評価を可能にする高精度で効率的な電力系統シミュレーションプラットフォーム、PGSimを開発する。

実験結果

リサーチクエスチョン

  • RQ1負荷変動下において、マルチエージェント深層強化学習手法は、従来のモデルベース制御を上回る二次電圧制御性能を達成できるか?
  • RQ2空間的割引係数の統合は、大規模マイクログリッド制御における学習効率とスケーラビリティをどのように向上させるか?
  • RQ3微分可能で学習ベースの通信プロトコルは、隣接する分散型発電機間の協調性をどの程度向上させるか?
  • RQ4PowerNetは、DGの切断や追加といった動的トポロジー変更に対して、完全な再トレーニングなしにどのように対応するか?
  • RQ5大規模マイクログリッドにおけるPowerNetの推論遅延はどの程度で、リアルタイム運用要件を満たしているか?

主な発見

  • 10%の負荷不均衡下でマイクログリッド-20環境において、PowerNetは平均報酬0.781を達成し、MPC(0.642)、IA2C(0.447)および他のMARLベースラインと比較して顕著に優れた性能を示した。
  • 40バスマイクログリッドでは、PowerNetは安定した学習を維持し、一貫した性能を発揮した一方、CommNetは収束せず、IA2Cよりも劣った性能を示した。
  • 40バス系におけるPowerNetの推論時間はわずか35.8msで、時間/サイズ比が0.90と安定しており、リアルタイム実行可能性とスケーラビリティを裏付けた。
  • マイクログリッド-20で事前学習したモデルからの適応により、DGユニットの追加・削除時において、完全な再トレーニングよりも高速な収束と優れた性能が達成された。
  • PowerNetは、モデル予測制御(MPC)法と比較して約19.6倍高速に収束し、優れたサンプル効率を示した。
  • アクションスムージング要因は、システムノイズ下でもポリシー実行を安定化させ、動的環境下でのロバストな性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。