Skip to main content
QUICK REVIEW

[論文レビュー] Real-world challenges for multi-agent reinforcement learning in grid-interactive buildings

Kingsley Nweye, Bo Liu|arXiv (Cornell University)|Nov 25, 2021
Smart Parking Systems Research被引用数 4
ひとこと要約

本論文は、グリッド連携ビルにおけるマルチエージェント強化学習(MARL)の現実世界の課題を9つ特定し、ベンチマーク化と再現可能性を向上させるための標準化されたフレームワークを提案する。長期間のオフライン学習による最適化されたルールベース制御(RBC)から得られるデータが、長期的なエネルギー柔軟性性能を顕著に向上させることを示している一方で、エージェント間の情報共有は、テストされた設定では顕著な利点をもたらさないことを明らかにした。

ABSTRACT

Building upon prior research that highlighted the need for standardizing environments for building control research, and inspired by recently introduced challenges for real life reinforcement learning control, here we propose a non-exhaustive set of nine real world challenges for reinforcement learning control in grid-interactive buildings. We argue that research in this area should be expressed in this framework in addition to providing a standardized environment for repeatability. Advanced controllers such as model predictive control and reinforcement learning (RL) control have both advantages and disadvantages that prevent them from being implemented in real world problems. Comparisons between the two are rare, and often biased. By focusing on the challenges, we can investigate the performance of the controllers under a variety of situations and generate a fair comparison. As a demonstration, we implement the offline learning challenge in CityLearn and study the impact of different levels of domain knowledge and complexity of RL algorithms. We show that the sequence of operations utilized in a rule based controller (RBC) used for offline training affects the performance of the RL agents when evaluated on a set of four energy flexibility metrics. Longer offline learning from an optimized RBC leads to improved performance in the long run. RL agents that learn from a simplified RBC risk poorer performance as the offline learning period increases. We also observe no impact on performance from information sharing amongst agents. We call for a more interdisciplinary effort of the research community to address the real world challenges, and unlock the potential of grid-interactive building

研究の動機と目的

  • グリッド連携ビルにおける強化学習(RL)の評価のための標準化されたベンチマークの欠如に対処すること。
  • マルチエージェント強化学習(MARL)の実用的導入を妨げる現実世界の課題を特定・形式化すること。
  • モデル予測制御(MPC)やルールベース制御(RBC)といった従来の制御手法と、RLの間で公平で体系的な比較を可能にすること。
  • オフライン学習の質とRBC設計が、その後のRLエージェントの性能に与える影響を実証すること。
  • 実世界への導入を加速させるために、建築科学と機械学習のコミュニティ間の横断的協働を提唱すること。

提案手法

  • グリッド連携ビルにおけるMARLの実用的導入障壁に焦点を当て、非包括的な9つの現実世界の課題(C1–C9)から成るフレームワークを提案する。
  • 都市学習(CityLearn)環境を用いて、オフライン学習課題(C8)を実装・評価し、現実世界の訓練シナリオをシミュレートする。
  • 基本バージョンと、より優れた運用論理を備えた最適化バージョンの2つのRBCから得られるデータを用いて、RLエージェント(SACおよびMARLISA)を学習させる。
  • 地域の平均日最大電力、負荷係数、ランピング、およびネット電力消費量の4つのエネルギー柔軟性指標を用いてエージェントの性能を評価する。
  • 再現可能性とコミュニティ全体のベンチマーク化を確保するため、共通インターフェース(OpenAI Gym)とオープンソース実装を採用する。
  • オフライン学習期間、RBCの運用シーケンス、エージェント間の情報共有が最終的性能に与える影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1ルールベース制御(RBC)における運用シーケンスの質—特に、オフライン事前学習データとしての品質—が、その後に学習されるRLエージェントの性能にどのように影響するか?
  • RQ2高品質なRBCからの長期間のオフライン学習は、グリッド連携ビルにおける長期的なエネルギー柔軟性性能を向上させるか?
  • RQ3マルチエージェントRLアルゴリズム間での情報共有が、主要なエネルギー柔軟性指標における性能に与える影響は何か?
  • RQ4より単純なRLアルゴリズム(例:SAC)は、現実世界のビル制御シナリオにおいて、より複雑なMARLアーキテクチャを上回る性能を示せるか?
  • RQ5既存のRBCがすでに顕著なエネルギー柔軟性を提供している場合、高度なRLコントローラーの導入によるマージナルな利点はどの程度か?

主な発見

  • 最適化されたRBCからの長期間のオフライン学習は、初期収束が遅くとも、地域の平均日最大電力、負荷係数、ランピングの低減において優れた長期的性能を達成する。
  • 簡素化されたRBCからのデータで学習したRLエージェントは、オフライン学習期間が延長するにつれて性能が徐々に悪化する傾向を示しており、劣悪な事前学習データが最終的な成果を劣化させることを示している。
  • SACとMARLISAの両アルゴリズム間で、4つのエネルギー柔軟性指標において顕著な性能差が認められず、この設定では情報共有の追加的複雑性に利点がないことが示された。
  • すべての設定において、ネット電力消費量はほとんど変化しなかったことから、RBC設計—特に高COPヒートポンプを用いた夜間充電に焦点を当てたもの—が、既に利用可能な柔軟性の大部分を捉え込んでいることが示唆された。
  • 最適化されたRBCは、ピーク需要の低減と負荷係数の改善において、すべてのRLコントローラーを大きく上回った。これは、複雑なRLシステムの導入よりも、既存の制御論理の改善がより効果的である可能性を示している。
  • 結果から、事前学習データの質がアルゴリズムの複雑さよりも重要であり、高精度なRBCは実世界への導入に向けた強力なベースラインとして機能できることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。