Skip to main content
QUICK REVIEW

[論文レビュー] Explainable AI: Deep Reinforcement Learning Agents for Residential Demand Side Cost Savings in Smart Grids

Hareesh Kumar, Priyanka Mary Mammen|arXiv (Cornell University)|Oct 19, 2019
Smart Grid Energy Management参考文献 17被引用数 5
ひとこと要約

本稿では、動的料金制度下で家庭用エネルギー貯蔵のコストを最小化するために、自律的に運用する深層強化学習(DRL)エージェントを提案する。エージェントは、シミュレーテッドスマートグリッド環境内での試行錯誤により、最適な充電/放電戦略を学習し、最大で14%のコスト削減を達成した。これは、需要応答プログラムと組み合わせると特に有効であり、バッテリーキャパシティと料金構造に基づいた意思決定プロセスの説明可能なインサイトを提供する。

ABSTRACT

Motivated by recent advancements in Deep Reinforcement Learning (RL), we have developed an RL agent to manage the operation of storage devices in a household and is designed to maximize demand-side cost savings. The proposed technique is data-driven, and the RL agent learns from scratch how to efficiently use the energy storage device given variable tariff structures. In most of the studies, the RL agent is considered as a black box, and how the agent has learned is often ignored. We explain the learning progression of the RL agent, and the strategies it follows based on the capacity of the storage device.

研究の動機と目的

  • 変動する電力料金の下で、データ駆動型かつ説明可能な強化学習エージェントを用いて、家庭用エネルギー貯蔵運用を最適化すること。
  • 強化学習エージェントのブラックボックス性を解消するために、その学習プロセスと意思決定戦略の分析および説明を行うこと。
  • 時間単位料金(ToD)および需要応答(DR)料金制度下で、バッテリーキャパシティがコスト削減と最適運用ポリシーに与える影響を評価すること。
  • 異なる貯蔵容量および料金制度において、RLエージェントのスケーラビリティと適応性を示すこと。
  • 家庭用エネルギーシステムにおける最適なバッテリーサイジングとリターン分析の基盤を提供すること。

提案手法

  • 家庭用電力消費と動的料金構造をシミュレートするカスタム環境を用いて、深層Qネットワーク(DQN)エージェントを訓練する。
  • エージェントは、時間帯、電力料金、バッテリー残量の状態特徴を観測し、バッテリーの充電または放電を実行する行動をとる。
  • 報酬関数は、ベースラインとの比較におけるコスト削減として定義される:$\text{cost}_\text{saving} = \left(1 - \frac{\text{Cost}(\text{RLAgent})}{\text{Cost}(\text{BaseLine})}\right) \times 100$。
  • 訓練の安定化に経験リプレイとターゲットネットワークを用い、探索と収束に最適化されたハイパーパrameterを設定する。
  • 訓練は1か月分の家庭負荷および料金データを用い、テストはその後続の1か月分のデータで実施する。また、需要応答シナリオに適応するため、モデルのファインチューニングも実施する。
  • バッテリー寿命を考慮し、充電を最大90%、放電を最大10%の容量に制限する制約を組み込む。

実験結果

リサーチクエスチョン

  • RQ1異なるバッテリーキャパシティにおいて、DRLエージェントの家庭用電力コスト削減性能はどのように変化するか?
  • RQ2バッテリーキャパシティと料金構造に応じて、RLエージェントはどのような意思決定戦略を採用するか?
  • RQ3需要応答(DR)プログラムの導入が、コスト削減とエージェント行動に与える影響は何か?
  • RQ4RLエージェントの学習プロセスと戦略を意味的に説明可能かつ可視化可能か?
  • RQ5ToDおよびDR料金制度下で、コスト削減を最大化する最適なバッテリーキャパシティは何か?

主な発見

  • 標準的な時間単位料金(ToU)制度下では、RLエージェントが6〜8%のコスト削減を達成したが、需要応答(DR)プログラムと組み合わせると、12〜14%にまで向上した。
  • 15,000Whを超えるバッテリーキャパシティでは、コスト削減が頭打ちとなり、大容量システムではリターンの逓減が見られた。
  • 低容量バッテリー(例:5kWh)は高容量シナリオへの一般化に失敗したが、高容量エージェントは低容量状態の管理に成功した。
  • エージェントは、低コスト期間(22:00〜06:00)に充電し、高コスト期間に放電する戦略を学習した。大容量システムでは、フル充電戦略が顕在化した。
  • エージェントの行動は説明可能であった:低価格時に一貫して充電し、高価格時に放電する戦略を採用しており、貯蔵容量に応じてスケーリングされた。
  • 事前に学習したエージェントをDRシナリオにファインチューニングすることで、日次需要制限やペナルティ料金といった新たな制約への効果的適応が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。