[論文レビュー] Dynamic Energy Dispatch Based on Deep Reinforcement Learning in IoT-Driven Smart Isolated Microgrids
本稿では、ディーゼル発電機、太陽光発電、バッテリを備えたIoT駆動の孤立型マイクログリッドにおける動的エネルギー配分のため、有限時間枠の深層強化学習アルゴリズム、FH-DDPG および FH-RDPG を提案する。問題を有限時間枠の部分的に観測可能なマルコフ意思決定過程(POMDP)としてモデル化することで、ベースラインのDRLおよびMPC手法に比べ、安定性と性能が向上し、履歴データを用いた負荷および太陽光発電の不確実性の扱いが改善され、運用コストが低減された。
Microgrids (MGs) are small, local power grids that can operate independently from the larger utility grid. Combined with the Internet of Things (IoT), a smart MG can leverage the sensory data and machine learning techniques for intelligent energy management. This paper focuses on deep reinforcement learning (DRL)-based energy dispatch for IoT-driven smart isolated MGs with diesel generators (DGs), photovoltaic (PV) panels, and a battery. A finite-horizon Partial Observable Markov Decision Process (POMDP) model is formulated and solved by learning from historical data to capture the uncertainty in future electricity consumption and renewable power generation. In order to deal with the instability problem of DRL algorithms and unique characteristics of finite-horizon models, two novel DRL algorithms, namely, finite-horizon deep deterministic policy gradient (FH-DDPG) and finite-horizon recurrent deterministic policy gradient (FH-RDPG), are proposed to derive energy dispatch policies with and without fully observable state information. A case study using real isolated MG data is performed, where the performance of the proposed algorithms are compared with the other baseline DRL and non-DRL algorithms. Moreover, the impact of uncertainties on MG performance is decoupled into two levels and evaluated respectively.
研究の動機と目的
- 高再生可能エネルギー率と不確実な負荷および発電状態を有する孤立型マイクログリッドにおける動的エネルギー配分の課題に対処すること。
- 現実のマイクログリッド運用に一般的な有限時間枠・部分的に観測可能な環境に特化した安定な深層強化学習アルゴリズムの開発。
- 太陽光発電とバッテリーストレージを最適に統合することで、ディーゼル発電機の運用コストを最小化すること。
- 負荷および太陽光発電の不確実性がマイクログリッド性能に与える影響を、分離可能な分析により評価すること。
- 実世界のデータを用いて、提案されたアルゴリズムをベースラインのDRLおよびモデルベースのMPC手法と比較すること。
提案手法
- 負荷および太陽光発電の不確実性を考慮したエネルギー配分を表現するため、有限時間枠の部分的に観測可能なマルコフ意思決定過程(POMDP)モデルを構築する。
- 2つの新規DRLアルゴリズムを提案:完全に観測可能な状態を想定した有限時間枠ディープ・デターミニスティック・ポリシー・グラデント(FH-DDPG)と、部分的に観測可能な状態を想定した有限時間枠再帰的DDPG(FH-RDPG)。
- 履歴的な負荷およびPVデータを用いてポリシーを学習し、確率的システムダイナミクスをシミュレートすることで一般化性と安定性を向上させる。
- FH-RDPGでは、時間的依存性をモデル化し、部分的観測を処理するために長短期記憶(LSTM)ネットワークを採用する。
- 比較のためのベンチマークとして、反復的線形二次ガウス(iLQG)最適化を用いたモデル予測制御(MPC)を適用する。
- 2017年7月の実際の孤立型マイクログリッドデータを用いて性能を評価し、7日、14日、21日分の履歴窓を用いて学習し、同じ日のデータをテストに使用する。
実験結果
リサーチクエスチョン
- RQ1有限時間枠DRLアルゴリズムは、孤立型マイクログリッドにおける動的エネルギー配分において、どのように安定性と性能を向上させるか?
- RQ2FH-DDPGおよびFH-RDPGは、不確実性下での運用コストとロバストネスの観点から、ベースラインのDDPGおよびRDPGに比べてどの程度優れているか?
- RQ3履歴データではなく、同じ日のデータで学習した場合、DRLベースの配分におけるポリシーの一般化性と性能にどのような影響を与えるか?
- RQ4負荷および太陽光発電の不確実性がマイクログリッド性能に与える影響は何か? そして、それを定量的に分離可能か?
- RQ5一部の状態情報(例:バッテリーソース・オブ・コンディション(SoC)のみ、全システム状態ではない)しか入手できない状況でも、提案されたアルゴリズムはエネルギー配分を効果的に管理できるか?
主な発見
- 提案されたFH-DDPGおよびFH-RDPGアルゴリズムは、完全に観測可能な状態および部分的に観測可能な状態の両方において、ベースラインのDDPGおよびRDPGに比べ、ディーゼル発電機の運用コストを顕著に低減した。
- FH-RDPGはPOMDP環境で優れた性能を示し、通常の実世界展開で見られるような限られた状態情報のもとでも効果的な意思決定が可能であることを実証した。
- FH-DDPGおよびFH-RDPGの性能は、同じ日のデータまたは7〜21日分の履歴データで学習した場合でも安定的かつ一貫しており、優れた一般化能力を示した。
- MPC-iLQGおよびMPC-iLQG-POMDPベンチマークを上回り、特に不確実性下で顕著な優位性を示した。これは、モデルベースの予測制御に比べ、エンドツーエンドのDRLの利点を裏付けた。
- RNNを用いたPVおよび負荷のモデル予測誤差は、それぞれ正規化MSEで2.27×10⁻³および1.39×10⁻³であった。これらの誤差を低減すれば、MPCベースの手法の性能もさらに向上する可能性がある。
- 本研究では、不確実性の影響を2段階に分離して定量的に評価し、DRLベースの手法が1日先の予測誤差に対してもロバストであることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。