Skip to main content
QUICK REVIEW

[論文レビュー] Lessons Learned from Data-Driven Building Control Experiments: Contrasting Gaussian Process-based MPC, Bilevel DeePC, and Deep Reinforcement Learning

Loris Di Natale, Yingzhao Lian|arXiv (Cornell University)|May 31, 2022
Building Energy and Comfort Optimization被引用数 7
ひとこと要約

この論文は、多様な建物における実世界の建物制御実験を通じて、ガウス過程に基づくモデル予測制御(GP-MPC)、二段階型データ駆動予測制御(DeePC)、深層強化学習(DRL)を比較している。各手法をデータ効率、計算負荷、ロバスト性、導入のしやすさの観点で評価し、単一の手法が普遍的に最適であるとは結論付けず、データの可用性、システムの複雑さ、計算リソースに応じて最適な選択が異なると結論している。

ABSTRACT

This manuscript offers the perspective of experimentalists on a number of modern data-driven techniques: model predictive control relying on Gaussian processes, adaptive data-driven control based on behavioral theory, and deep reinforcement learning. These techniques are compared in terms of data requirements, ease of use, computational burden, and robustness in the context of real-world applications. Our remarks and observations stem from a number of experimental investigations carried out in the field of building control in diverse environments, from lecture halls and apartment spaces to a hospital surgery center. The final goal is to support others in identifying what technique is best suited to tackle their own problems.

研究の動機と目的

  • GP-MPC、二段階型DeePC、DRLという3つの現代的なデータ駆動制御手法を、実世界の建物制御応用において評価・比較すること。
  • 各手法のデータ要件、計算複雑性、ロバスト性、使用のしやすさという観点での強みと限界を特定すること。
  • システムの特性と利用可能なリソースに基づいて、研究者および実務家が最も適したデータ駆動制御手法を選択するための実用的ガイダンスを提供すること。
  • 病院、講義室、アパートにおける実際の導入から得られる実験的知見を強調し、理論的性能ではなく現実世界の適用可能性に焦点を当てる。

提案手法

  • GP-MPCはガウス過程を用いて建物の熱的ダイナミクスをモデル化し、不確実性の定量化を組み込み、再びホライズンにおける最適化フレームワークに予測平均と分散を統合する。
  • 二段階型DeePCは、行動的システム理論を活用して、明示的なモデル構造を必要とせず、データから直接制御方策を学習する。不確実性への耐性を備えた二次計画法に基づく最適化を用いる。
  • DRLは深層ニューラルネットワークを用いて、データからエンドツーエンドの制御方策を学習する。エージェントは報酬に基づく学習を用いて、事前学習段階で観測値から行動にマッピングする。
  • すべての手法は、病院の手術室、ポリドーム(講義室)、ネストビルのアパートという実建物で評価され、多様な環境条件からの歴史的データが使用された。
  • データ効率、計算コスト(オフラインおよびオンライン)、制約処理、不確実な状況や外れ値データへのロバスト性という観点から、制御戦略を比較した。
  • 天気予報はGP-MPCとDeePCで予測に使用されたが、DRLは経験から将来の状況を暗黙的に予測する。ただし、より高いロバスト性を得るためには、観測に予報を追加可能である。

実験結果

リサーチクエスチョン

  • RQ1GP-MPC、二段階型DeePC、DRLは、実建物制御シナリオにおいて、データ効率とモデル学習要件の観点でどのように比較されるか?
  • RQ2実用的な建物制御導入において、各手法のオフラインおよびオンラインの計算負荷はどの程度か?
  • RQ33つの手法は、不確実な状況や外れ値データに対して制約をどのように処理し、ロバスト性を維持するか?
  • RQ4DRLエージェントは、明示的な予報なしで外れ値の状況にどの程度一般化できるか?モデルベース手法と比較してどうか?
  • RQ5GP-MPCの不確実性推定とDeePCのロバストな定式化は、実世界の環境で信頼性の高い制御をどのように実現するか?

主な発見

  • GP-MPCは高いデータ効率を示し、GPUを用いない状態で15〜120秒の間で300ポイントのデータでモデル適合が可能であり、不確実性推定によりロバスト性が向上した。
  • DeePCはオフライン計算を必要とせず、導入が最も簡単だったが、線形または近似的に線形なシステムに限定され、ロバストな定式化の調整が重要だった。
  • DRLは大規模なデータセットと、GPUを用いた最大数日間のオフライン学習を必要としたが、ニューラルネットワークの1回の順伝播でほぼ即時の制御行動が可能となり、オンライン推論が高速だった。
  • GP-MPCは実行時の計算負荷が最も高く、非凸最適化のため1回の制御更新に20秒を要したが、通常5〜15分のサンプリング間隔であれば許容可能だった。
  • すべての手法が実建物での温度制御に成功したが、DRLは明示的な制約がなく、分布外データに対して感受性が高いため、制約違反を示した傾向があった。
  • GP-MPCの不確実性推定とDeePCのロバストな定式化により、制約違反が防止されたが、DRLエージェントは安全な運用を保証するための追加メカニズムを必要とした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。