Skip to main content
QUICK REVIEW

[論文レビュー] Experimental analysis of data-driven control for a building heating system

Giuseppe Tommaso Costanzo, Sandro Iacovella|arXiv (Cornell University)|Jul 13, 2015
Building Energy and Comfort Optimization参考文献 10被引用数 4
ひとこと要約

本稿では、動的料金を想定した建物の暖房制御最適化を目的として、モデル支援型バッチ強化学習、特に仮想サポートタプルを用いたフィットネスQイテレーションとドメイン知識の形状を組み合わせたデータ駆動型制御手法を提案する。シミュレーションでは20日以内にほぼ最適な性能に収束し、外気温が変動する状況下でも実際の生活実験施設で実用的で有用な制御方策が得られた。

ABSTRACT

Driven by the opportunity to harvest the flexibility related to building climate control for demand response applications, this work presents a data-driven control approach building upon recent advancements in reinforcement learning. More specifically, model assisted batch reinforcement learning is applied to the setting of building climate control subjected to a dynamic pricing. The underlying sequential decision making problem is cast on a markov decision problem, after which the control algorithm is detailed. In this work, fitted Q-iteration is used to construct a policy from a batch of experimental tuples. In those regions of the state space where the experimental sample density is low, virtual support samples are added using an artificial neural network. Finally, the resulting policy is shaped using domain knowledge. The control approach has been evaluated quantitatively using a simulation and qualitatively in a living lab. From the quantitative analysis it has been found that the control approach converges in approximately 20 days to obtain a control policy with a performance within 90% of the mathematical optimum. The experimental analysis confirms that within 10 to 20 days sensible policies are obtained that can be used for different outside temperature regimes.

研究の動機と目的

  • 建物暖房システムのためのデータ駆動型制御戦略を開発し、需要応答用途に強化学習を活用すること。
  • 建物気候制御におけるデータのスパarsity問題に対処するため、ニューラルネットワークを用いて実験的タプルに仮想サンプルを追加する。
  • 学習された制御方策にドメイン知識を統合することで、方策のパフォーマンスを向上させること。
  • シミュレーションによる定量的評価と、現実世界の生活実験施設での定性的評価を通じて、手法を検証すること。
  • 動的電力料金下で、ほぼ最適なパフォーマンスへの収束を示すこと。

提案手法

  • 建物気候制御における逐次的意思決定をモデル化するため、制御問題をマルコフ決定過程(MDP)として定式化する。
  • 実験データタプルのバッチから制御方策を学習するために、フィットネスQイテレーションを採用する。
  • 状態空間の低データ領域では、人工ニューラルネットワークが仮想サポートタプルを生成し、方策の一般化性能を向上させる。
  • 得られた方策はドメイン知識を用いて精錬され、耐性および実用性が向上する。
  • 手法はシミュレーションおよび生活実験施設環境における実世界のテストを通じて検証される。
  • エネルギー費用削減を促進するため、動的電力料金を報酬信号として用いる。

実験結果

リサーチクエスチョン

  • RQ1建物暖房システムにおいて、限られた実験データからデータ駆動型制御方策を効率的に学習できるか?
  • RQ2ニューラルネットワークを用いて仮想サポートタプルを追加することで、低サンプリング領域における方策パフォーマンスにどのような影響を与えるか?
  • RQ3ドメイン知識の統合が、学習された強化学習方策の実用性および耐性にどの程度向上効果をもたらすか?
  • RQ4動的料金下で、制御方策はどの程度の速さでほぼ最適なパフォーマンスに収束するか?
  • RQ5学習された方策は、実世界の条件下で異なる外気温条件に一般化できるか?

主な発見

  • データ駆動型制御手法は、シミュレーションで約20日間の学習期間で、数学的最適解の90%以内のパフォーマンスに収束した。
  • 生活実験施設では、外気温が多様な条件下でも、10〜20日以内に妥当で実用的な制御方策が得られた。
  • ニューラルネットワークを用いた仮想サポートタプルの統合により、状態空間のデータがスカスリの領域における方策パフォーマンスが向上した。
  • ドメイン知識の活用により、原始的な強化学習出力と比較して、より耐性があり実用的な制御方策が得られた。
  • 動的料金シグナルへの強い適応性を示し、建物暖房システムにおける効果的な需要応答を可能にした。
  • 結果から、バッチ強化学習を実世界の建物気候制御に適用することが実現可能であり、実用的な収束期間を有することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。