[論文レビュー] Bi-level Off-policy Reinforcement Learning for Volt/VAR Control Involving Continuous and Discrete Devices
本稿では、アクティブな配電網におけるバッテリーバランス制御(Volt/VAR制御)のための二段階的オフポリシー深層強化学習フレームワークを提案する。この手法は、システムモデルを必要とせず、遅い時定数の離散的デバイス(例:OLTC)と速い時定数の連続的デバイス(例:DG)を同時に最適化する。方法では、離散的行動にマルチ・ディクリート・ソフトアクトアクリティック(MDSAC)を、連続的行動にオフポリシー・ソフトアクトアクリティックを適用し、訓練の安定性を向上させるために新規のマルチ・タイムスケール・オフポリシー補正(MTOPC)を導入。モデルフリー設定下で、ベースライン手法と比較して30%低い損失を達成し、ほぼ最適な性能を実現した。
In Volt/Var control (VVC) of active distribution networks(ADNs), both slow timescale discrete devices (STDDs) and fast timescale continuous devices (FTCDs) are involved. The STDDs such as on-load tap changers (OLTC) and FTCDs such as distributed generators should be coordinated in time sequence. Such VCC is formulated as a two-timescale optimization problem to jointly optimize FTCDs and STDDs in ADNs. Traditional optimization methods are heavily based on accurate models of the system, but sometimes impractical because of their unaffordable effort on modelling. In this paper, a novel bi-level off-policy reinforcement learning (RL) algorithm is proposed to solve this problem in a model-free manner. A Bi-level Markov decision process (BMDP) is defined to describe the two-timescale VVC problem and separate agents are set up for the slow and fast timescale sub-problems. For the fast timescale sub-problem, we adopt an off-policy RL method soft actor-critic with high sample efficiency. For the slow one, we develop an off-policy multi-discrete soft actor-critic (MDSAC) algorithm to address the curse of dimensionality with various STDDs. To mitigate the non-stationary issue existing the two agents' learning processes, we propose a multi-timescale off-policy correction (MTOPC) method by adopting importance sampling technique. Comprehensive numerical studies not only demonstrate that the proposed method can achieve stable and satisfactory optimization of both STDDs and FTCDs without any model information, but also support that the proposed method outperforms existing two-timescale VVC methods.
研究の動機と目的
- Volt/VAR制御(VVC)において、正確なシステムモデルに依存せずに、遅い時定数の離散的デバイス(STDDs)と速い時定数の連続的デバイス(FTCDs)を効果的に統合する課題に対処する。
- 急速に進化するアクティブな配電網(ADNs)では不切となる、広範なモデリング作業を要する従来のモデルベース最適化手法の限界を克服する。
- 二つの異なる時定数スケールで同時に最適化する、データ駆動型・モデルフリーな強化学習フレームワークを構築し、STDDsとFTCDsを統合的に最適化する。
- 遅い時定数のエージェント(STA)と速い時定数のエージェント(FTA)が同時に学習し合い、お互いの経験分布に干渉する状況下で、マルチエージェント二段階強化学習設定における訓練プロセスの安定性を確保する。
- オフポリシー手法と新規のマルチ・タイムスケール補正機構を活用することで、VVCにおいて高いサンプル効率とほぼ最適な性能を達成する。
提案手法
- 二段階の時定数スケールを持つVVC問題を、二段階のマーカフ決定過程(BMDP)として定式化し、STDDs(遅い)とFTCDs(速い)の制御を別々のサブ問題に分離する。
- DG や SVC などの連続的制御デバイスを対象とする速い時定数エージェント(FTA)を、オフポリシー・ソフトアクトアクリティック(SAC)を用いて実装し、高いサンプル効率を達成する。
- 離散的行動空間における次元の呪いを緩和するため、新規のマルチ・ディクリート・ソフトアクトアクリティック(MDSAC)アルゴリズムを用いて遅い時定数エージェント(STA)を設計。価値関数の分解を実現する。
- STA と FTA 間の分布シフトを是正するため、重要度サンプリングに基づくマルチ・タイムスケール・オフポリシー補正(MTOPC)手法を導入。共同訓練における非定常性を低減する。
- 24,000 の FTA ステップのリプレイバッファを用い、バッチ更新とランダムな重み初期化を伴う、PyTorch ベースのフレームワークでエージェントをエンドツーエンドに訓練する。
- MTOPC を適用し、リプレイバッファ内の遷移を再重み付けすることで、FTA の経験から得られる補正済み期待値に基づいて STA の方策更新が行われるよう保証。これは、FTA の方策が古くなっても有効である。
実験結果
リサーチクエスチョン
- RQ1モデルフリーで二段階のオフポリシー強化学習フレームワークは、Volt/VAR制御において、遅い時定数の離散的デバイスと速い時定数の連続的デバイスを効果的に統合できるか?
- RQ2VVC のためのマルチエージェントRLにおいて、離散的行動空間(例:OLTCタップ位置、コンデンサースイッチング)における次元の呪いは、どのように緩和できるか?
- RQ3二つのエージェントが異なる時定数スケールで動作するが、非定常な経験分布の干渉により方策が干渉する状況下で、訓練をどのように安定化できるか?
- RQ4モデルフリーDRL手法は、モデルベースまたは単一時定数スケールのDRLベースラインと比較して、損失低減および電圧プロファイル改善の観点でどの程度優れているか?
- RQ5提案されたMTOPC手法は、補正なしの標準的なオフポリシー訓練と比較して、訓練の安定性と収束速度を顕著に向上させるか?
主な発見
- 33バス系統テスト系統において、提案手法はネットワークの有効電力損失を 8.30 × 10⁻² MW に抑え、S-DQN(6.05 × 10⁻² MW)と A-OPT(1.08 × 10⁻¹ MW)を上回ったが、オラクルOPT(4.59 × 10⁻² MW)よりわずかに高い。
- 電圧違反率(VVR)は 0 p.u. に低下させ、最適解と同一であり、タップ操作回数は 2.4 に抑えられ、A-OPT(7.0)や S-DQN(4.3)と比較して顕著に低い。
- MTOPCを適用した場合、2,000 FTA ステップ以内にほぼ最適な性能に到達した。非OPCバージョンははるかに多くのサンプルを必要とし、ランダムシード間で高い分散を示した。
- MTOPC補正重み ω′ の平均値は、訓練が進むにつれて 1.0 付近に安定し、古くなったFTA方策の補正が効果的に行われていることを示している。後段階では標準偏差も低く保たれた。
- STA に用いられたMDSACアルゴリズムは、安定性と収束速度の両面でDQNを上回り、高次元の離散的行動空間の処理において有効であることを示した。
- モデルフリー手法は、ネットワークのトポロジーおよびパラメータを入手できない状況でも、A-OPT や S-DQN がFTA最適化にオラクルモデルに依存するのとは異なり、競争力のある性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。