Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Deep Reinforcement Learning for HVAC Control in Commercial Buildings

Liang Yu, Yi Sun|arXiv (Cornell University)|Jun 25, 2020
Building Energy and Comfort Optimization参考文献 39被引用数 4
ひとこと要約

本論文は、熱的ダイナミクスや不確実パラメータの事前知識を必要とせずに、複数ゾーンの商業ビルにおけるHVACエネルギー費用を最小化するためのアテンション機構を備えたマルチエージェント深層強化学習(MADRL)アルゴリズムを提案する。実世界の占拠状況や電力料金の変動を想定した条件下で、ベースライン手法と比較して総エネルギー費用を75.25%低減し、高い有効性、頑健性、スケーラビリティを示している。

ABSTRACT

In commercial buildings, about 40%-50% of the total electricity consumption is attributed to Heating, Ventilation, and Air Conditioning (HVAC) systems, which places an economic burden on building operators. In this paper, we intend to minimize the energy cost of an HVAC system in a multi-zone commercial building under dynamic pricing with the consideration of random zone occupancy, thermal comfort, and indoor air quality comfort. Due to the existence of unknown thermal dynamics models, parameter uncertainties (e.g., outdoor temperature, electricity price, and number of occupants), spatially and temporally coupled constraints associated with indoor temperature and CO2 concentration, a large discrete solution space, and a non-convex and non-separable objective function, it is very challenging to achieve the above aim. To this end, the above energy cost minimization problem is reformulated as a Markov game. Then, an HVAC control algorithm is proposed to solve the Markov game based on multi-agent deep reinforcement learning with attention mechanism. The proposed algorithm does not require any prior knowledge of uncertain parameters and can operate without knowing building thermal dynamics models. Simulation results based on real-world traces show the effectiveness, robustness and scalability of the proposed algorithm.

研究の動機と目的

  • 商業ビルにおけるHVACシステムの高いエネルギー消費(総電力使用量の40%〜50%を占める)を低減すること。
  • 占拠のランダム性、電力料金の変動、室内空気質制約といった不確実で動的な条件下でのHVACエネルギー費用の最小化に挑戦すること。
  • 建物の熱的ダイナミクスモデルや外気温、占拠レベルなどの不確実パラメータに関する事前知識がなくても動作する制御アルゴリズムの開発。
  • 熱的快適性および室内空気質の快適性を維持しながら、複雑で結合された環境においてもシステムのスケーラビリティと頑健性を確保すること。

提案手法

  • マルコフゲームに再定式化することで、複数ゾーン間の相互作用と制約をモデル化する。
  • ゾーン間での協調的意思決定を可能にする、アテンション機構を備えたマルチエージェント深層強化学習フレームワークを設計する。
  • 非凸的・非分離的環境における探索と安定学習を可能にするため、ソフトアクタクリティカル(SAC)アルゴリズムを採用して学習を実施する。
  • ゾーン温度、CO₂濃度、占拠状況、外気温、電力料金を含む状態表現を組み込む。
  • 高次元の行動空間(例:30ゾーンでは11^31の行動)に対応するため、大容量の経験リプレイバッファを実装する。
  • 実世界の建物トレースを用いてエンドツーエンドでエージェントを学習させ、モデル知識なしに動的かつ不確実な状況に適応可能にする。

実験結果

リサーチクエスチョン

  • RQ1熱的ダイナミクスモデルに依存せずに、マルチエージェント深層強化学習を用いて複数ゾーンの商業ビルにおけるHVACエネルギー費用を効果的に最小化できるか?
  • RQ2外気温や電力料金などの不確実パラメータおよびランダムなゾーン占拠状況下で、提案手法の性能はどの程度か?
  • RQ3空間的・時間的に結合されたHVAC制御において、アテンション機構がエージェント間の協調性をどの程度向上させるか?
  • RQ4熱的ダイナミクスのモデル不確実性や摂動に対して、アルゴリズムはどの程度頑健か?
  • RQ5ゾーン数の増加に伴って、アルゴリズムのスケーラビリティはどの程度か?

主な発見

  • 提案手法は、実世界の条件下でランダムサーチ(RS)ベースラインと比較して、総エネルギー費用(TEC)を75.25%低減した。
  • ヒューリスティック戦略(HS)と比較して、TECを56.50%削減し、コスト最小化の面で優れた性能を示した。
  • ランダムな摂動下でも頑健性を維持し、3つの摂動シナリオにおいて平均絶対温度偏差(ATD)≤1.4°C、平均CO₂偏差(ACD)≤40 ppmを達成した。
  • 20,000回の学習エピソードにわたり収束が安定しており、平均エピソード報酬が時間経過とともに増加し、安定化する傾向を示しており、効果的な学習が実現している。
  • 30ゾーンまでスケーラブルであり、11^31という大規模な行動空間を有するが、高次元制御タスクにおいても性能を維持した。
  • アテンション機構によりエージェント間の効果的な協調が可能となり、高価格期における総空気供給量が削減され、エネルギー節約に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。