Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Voltage Control using Structure-Driven Hierarchical Deep Reinforcement Learning

Sayak Mukherjee, Renke Huang|arXiv (Cornell University)|Jan 29, 2021
Power System Optimization and Stability参考文献 19被引用数 8
ひとこと要約

本論文は、電力系統におけるスケーラブルな緊急電圧制御のための構造駆動型階層的深層強化学習(DRL)フレームワークを提案する。系統を領域に分解し、並列に分散型の低レベルDRLエージェントを訓練し、上位のコーディネータが強化された拡張ランダムサーチを用いて行動を調整することで、集中型学習と比較して学習時間を約60%短縮した。その一方で、複数の故障シナリオにおいて同等または優れた電圧回復性能を達成した。

ABSTRACT

This paper presents a novel hierarchical deep reinforcement learning (DRL) based design for the voltage control of power grids. DRL agents are trained for fast, and adaptive selection of control actions such that the voltage recovery criterion can be met following disturbances. Existing voltage control techniques suffer from the issues of speed of operation, optimal coordination between different locations, and scalability. We exploit the area-wise division structure of the power system to propose a hierarchical DRL design that can be scaled to the larger grid models. We employ an enhanced augmented random search algorithm that is tailored for the voltage control problem in a two-level architecture. We train area-wise decentralized RL agents to compute lower-level policies for the individual areas, and concurrently train a higher-level DRL agent that uses the updates of the lower-level policies to efficiently coordinate the control actions taken by the lower-level agents. Numerical experiments on the IEEE benchmark 39-bus model with 3 areas demonstrate the advantages and various intricacies of the proposed hierarchical approach.

研究の動機と目的

  • 大規模電力系統の電圧制御における集中型および分散型強化学習の限界、すなわち学習が遅い、スケーラビリティに欠ける、連携が不十分であるといった問題を解決すること。
  • 電力システムの自然な領域的構造を活用して、効率的な学習と展開が可能なスケーラブルでモジュラーなDRLアーキテクチャを構築すること。
  • 多様な故障条件下でも電圧回復性能を維持または向上させながら、学習時間を顕著に短縮すること。
  • 正確なシステムモデルに依存せずに、耐障害性があり適応的な緊急負荷遮断を可能にし、複数の事故状況下でも電圧安定性を確保すること。
  • IEEE 39バス系統を用いて複数の故障シナリオで手法を検証し、訓練データに含まれない故障にも一般化できることを示すこと。

提案手法

  • フレームワークは二段階の階層的DRLアーキテクチャを採用している:低レベルのエージェントは事前に定義された系統領域内で独立して動作し、局所的な電圧回復ポリシーを学習する。
  • 上位のコーディネータエージェントは、低レベルエージェントからのポリシー更新を用いて、領域間で知的に制御行動を選択・調整する。
  • 両方の低レベルおよび上位レベルDRLエージェントの効率的学習のために、制約付き拡張ランダムサーチ(CARS)の強化版が使用される。
  • 低レベルエージェントは、各領域あたり9つの故障シナリオを用いて並列に学習され、学習中にリアルタイムでポリシー更新をコーディネータに供給する。
  • コーディネータは低レベルエージェントと同時に学習され、シミュレーション時間を短縮するために、故障シナリオのサブセット(3つの故障持続時間:0、0.05、および0.08秒)のみを用いる。
  • 低レベル学習と構造的クラスタリング(領域別分割)による階層の強制によって、マルチエージェントRLにおける非定常性問題を回避する。

実験結果

リサーチクエスチョン

  • RQ1階層的DRLフレームワークは、集中型DRLと同等または優れた電圧回復性能を達成しつつ、学習時間を短縮できるか?
  • RQ2分散型低レベルエージェントと上位コーディネータの連携は、多様な故障条件下での電圧安定性をどのように向上させるか?
  • RQ3構造駆動型階層的設計は、大規模な集中型学習と比較して、スケーラビリティと学習時間の短縮にどの程度寄与するか?
  • RQ4提案手法は、訓練データに含まれない故障位置に対しても一般化できるか?
  • RQ5学習中に低レベルポリシー更新をリアルタイムで共有することは、上位コーディネータの収束性と性能にどのように影響を与えるか?

主な発見

  • 階層的DRLアプローチにより、合計の学習時間が2.29時間に短縮され、集中型学習の5.705時間と比較して60%短縮された。
  • 上位のコーディネータは、すべての故障シナリオにおいて集中型DRLポリシーと同等または優れた平均報酬を達成した。特に、集中型手法が電圧回復に失敗したケースでも同様の性能を示した。
  • バス15のような重要な故障バスでは、階層的設計が安全範囲内に電圧を回復させたが、集中型手法ではその達成に失敗した。
  • 本手法は頑健な一般化性を示した:訓練中に使用されなかった故障バスに対しても安定した性能を発揮し、ポリシーの一般化能力を確認した。
  • 低レベルポリシー更新をリアルタイムで共有してコーディネータを学習させたことで、収束が速く、報酬値も高くなった。
  • 領域1、2、3における低レベルエージェントの領域別分散学習時間は、それぞれ35.87分、44.04分、53.06分であり、コーディネータの学習は2.26時間で完了した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。