Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Multi-Agent Deep Reinforcement Learning Framework for Whole-building HVAC Control

Vinay Hanumaiah, Şahika Genç|arXiv (Cornell University)|Oct 26, 2021
Building Energy and Comfort Optimization被引用数 4
ひとこと要約

本論文は、Ray RLlibとEnergyPlusを共同シミュレーションすることで、建物全体のHVAC制御を最適化するスケーラブルで分散型のマルチエージェント深層強化学習(DRL)フレームワークを提案する。加熱・冷却の設定温度を別々のエージェントで管理することで、熱的快適性を維持したまま75%以上のエネルギー削減を達成し、プロセス間同期を効率的に行うことで、CPUとGPUの異種環境における学習を高速化する。

ABSTRACT

It is estimated that about 40%-50% of total electricity consumption in commercial buildings can be attributed to Heating, Ventilation, and Air Conditioning (HVAC) systems. Minimizing the energy cost while considering the thermal comfort of the occupants is very challenging due to unknown and complex relationships between various HVAC controls and thermal dynamics inside a building. To this end, we present a multi-agent, distributed deep reinforcement learning (DRL) framework based on Energy Plus simulation environment for optimizing HVAC in commercial buildings. This framework learns the complex thermal dynamics in the building and takes advantage of the differential effect of cooling and heating systems in the building to reduce energy costs, while maintaining the thermal comfort of the occupants. With adaptive penalty, the RL algorithm can be prioritized for energy savings or maintaining thermal comfort. Using DRL, we achieve more than 75\\% savings in energy consumption. The distributed DRL framework can be scaled to multiple GPUs and CPUs of heterogeneous types.

研究の動機と目的

  • 商業ビルにおける高いエネルギー消費を低減するため、HVACシステムが総エネルギー消費の最大50%を占めるという課題に対処すること。
  • ルールベースおよびモデルベースの制御手法の限界を克服し、強化学習によるモデルフリーで適応可能な最適化を可能にすること。
  • 大規模ビルの複雑な熱的ダイナミクスに対応する多ゾーン・マルチエージェント制御を可能にする、スケーラブルで分散型のDRLフレームワークの開発。
  • 多様な気象条件およびエネルギー削減と熱的快適性のトレードオフを想定した状況下で、フレームワークの有効性を実証すること。
  • 実用的導入を念頭に、AWSなどの異種クラウドインスタンスを用いて、学習コストと収束時間を最適化すること。

提案手法

  • フレームワークは、Ray RLlibとEnergyPlusの間で共同シミュレーションインターフェースを採用し、EnergyPlusが建物の熱的ダイナミクスをシミュレートし、状態観測値をOpenAI Gym環境に提供する。
  • RLlibの強化学習エージェントは観測値に基づいて行動を決定し、エネルギー使用量と熱的快適性に基づいた報酬を受取り、ポリシー勾配法(例:PPO、APEX-DDPG)によりポリシーを更新する。
  • エネルギー使用コストと熱的快適性のバランスを取るために、差分ペナルティ係数(α)を導入し、エネルギー削減と温度違反のトレードオフ分析を可能にする。
  • 加熱・冷却の設定温度を別々のニューラルネットワークで管理するマルチエージェント制御を実装し、各モードごとに最適化を実現する。
  • RLlibのマルチワーカーアーキテクチャを活用し、EnergyPlusのコールバック関数とメッセージキューを介したプロセス間通信により、分散学習を実現する。
  • システムはAWSクラウドインスタンスにデプロイされ、GPUおよびCPU構成の両方で学習コストとパフォーマンスが評価された。

実験結果

リサーチクエスチョン

  • RQ1分散型DRLフレームワークは、異なる気象条件下でHVACエネルギー消費をどの程度低減できるか?
  • RQ2エネルギー-温度ペナルティ係数(α)は、エネルギー削減と熱的快適性のトレードオフにどのような影響を及けるか?
  • RQ3加熱・冷却に別々のエージェントを設けるマルチエージェント制御と、多ゾーン制御とを比較した場合、報酬、エネルギー使用量、温度違反の観点でどちらが優れているか?
  • RQ4PPOとAPEX-DDPGのどちらのDRLアルゴリズムが、同等のパフォーマンスを維持しながらも収束が速く、学習時間を短くできるか?
  • RQ5HVAC DRL学習において、学習コストと時間を最小化する最適なクラウドハードウェア(CPU/GPU)の組み合わせは何か?

主な発見

  • フレームワークは、ベースラインのルールベース制御と比較して、HVACエネルギー消費を75%以上削減した。
  • 全α値においてマルチエージェント制御がマルチゾーン制御を上回り、報酬が向上し、エネルギー使用量が低減し、温度違反も減少した。
  • APEX-DDPGはPPOに比べて84%高速に収束し、学習時間を60%短縮したが、同等の報酬値を達成した。
  • ml.g4dn.16xlarge AWSインスタンスは、テストされた構成の中で最も低い学習コスト(1.36ドル)と最短の収束時間(15分)を達成した。
  • システムはCPUとGPUの異種環境においても効率的にスケーリングされ、コールバックベースの同期により最小限の遅延で分散学習が可能となった。
  • 気象条件は性能に顕著な影響を及ぼす:湿度の高い都市では、外気温の安定性が高いため、温度違反が低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。