Skip to main content
QUICK REVIEW

[論文レビュー] Accelerated Deep Reinforcement Learning Based Load Shedding for Emergency Voltage Control

Renke Huang, Yujiao Chen|arXiv (Cornell University)|Jun 22, 2020
Power System Optimization and Stability参考文献 37被引用数 14
ひとこと要約

本稿では、電力系統における負荷 Shedding を通じた緊急電圧制御を目的とした、加速された深層強化学習(DRL)アルゴリズム PARS を提案する。導関数フリー最適化と Ray フレームワーク上での並列処理を活用することで、IEEE 300 バス系において訓練を 100 倍高速化(40 日間から 10 時間未塔)し、解法速度、収束性、耐障害性において MPC や PPO を上回りながら、高いスケーラビリティと一般化性能を維持している。

ABSTRACT

Load shedding has been one of the most widely used and effective emergency control approaches against voltage instability. With increased uncertainties and rapidly changing operational conditions in power systems, existing methods have outstanding issues in terms of either speed, adaptiveness, or scalability. Deep reinforcement learning (DRL) was regarded and adopted as a promising approach for fast and adaptive grid stability control in recent years. However, existing DRL algorithms show two outstanding issues when being applied to power system control problems: 1) computational inefficiency that requires extensive training and tuning time; and 2) poor scalability making it difficult to scale to high dimensional control problems. To overcome these issues, an accelerated DRL algorithm named PARS was developed and tailored for power system voltage stability control via load shedding. PARS features high scalability and is easy to tune with only five main hyperparameters. The method was tested on both the IEEE 39-bus and IEEE 300-bus systems, and the latter is by far the largest scale for such a study. Test results show that, compared to other methods including model-predictive control (MPC) and proximal policy optimization(PPO) methods, PARS shows better computational efficiency (faster convergence), more robustness in learning, excellent scalability and generalization capability.

研究の動機と目的

  • 既存の深層強化学習(DRL)手法が電力系統の緊急制御において計算効率が低く、スケーラビリティに欠ける問題に対処する。
  • リアルタイム電圧安定性制御に適した、高速で適応的かつスケーラブルな DRL ベースの負荷 Shedding 策を構築する。
  • 大規模電力系統における最先端の DRL アルゴリズムで一般的な、数時間から数日にわたる長時間の訓練を克服する。
  • 1 回の制御区間あたり 1 秒未塔の解法時間に短縮することで、DRL のリアルタイムグリッド運用への実用的導入を可能にする。
  • 多様な系統障害や未観測の運転状態においても耐障害性と一般化性能を確保する。

提案手法

  • 電力系統の電圧安定性制御に適応させた、拡張ランダムサーチ(ARS)に基づく導関数フリー DRL アルゴリズム PARS を提案する。
  • Ray フレームワークを統合することで、最大 1,000 コアの CPU にわたる高いスケーラビリティと効率的な並列処理を実現する。
  • 非線形ダイナミクスと時間的依存性を捉えるために、フィードフォワードニューラルネットワーク(FNN)と長短期記憶(LSTM)ネットワークをポリシー・モデルとして使用する。
  • 主なハイパーパramータを 5 つに限定することで、チューニングとデプロイの容易性を向上させる。
  • RLGC プラットフォームを活用して、電力系統シミュレーションにおける DRL ポリシーの訓練とデプロイを簡素化する。
  • ニューラルネットワークの順伝播によるアクション推論を適用し、リアルタイム制御に適した 1 秒未塔の推論時間を実現する。

実験結果

リサーチクエスチョン

  • RQ1導関数フリー DRL アルゴリズムは、既存手法と比較して、大規模電力系統制御において著しく高速な訓練収束を達成できるか?
  • RQ2PARS のスケーラビリティは、訓練の大規模電力系統ポリシーにおいて、CPU コア数の増加に伴いどのように変化するか?
  • RQ3解法時間、収束速度、耐障害性の観点で、PARS はモデル予測制御(MPC)やプロキシマル・ポリシー最適化(PPO)をどの程度上回るか?
  • RQ4FNN と比較して、ポリシー・ネットワークに LSTM を使用することで、未観測の故障シナリオへの一般化性能が向上するか?
  • RQ5PARS は緊急電圧制御シナリオにおいて、リアルタイム制御性能(1 回の制御区間あたり 1 秒未塔)を達成できるか?

主な発見

  • PARS は IEEE 300 バス系の訓練時間を約 40 日間から 10 時間未塔に短縮し、100 倍の高速化を達成した。
  • PARS は 1 回の制御アクションあたり 0.72 秒の解法時間を達成し、リアルタイム要件(1 区間あたり 0.5 秒未塔)を満たした。
  • MPC と比較して、同等の電圧回復性能を達成したが、計算時間は 88 倍短縮された(0.72 秒 vs. 63.31 秒)。
  • PARS は収束速度と耐障害性の両面で並列 PPO を上回り、訓練中の異なるランダムシード間で低い分散を示した。
  • LSTM を用いたポリシーは、FNN を用いたポリシーと比較して、より優れた計算効率と未観測の故障シナリオへの一般化性能を示した。
  • PARS は 1,000 コアにまでほぼ線形にスケーリングされ、性能の飽和が見られず、高い並列スケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。