Skip to main content
QUICK REVIEW

[論文レビュー] Towards Optimal District Heating Temperature Control in China with Deep Reinforcement Learning

Adrien Le-Coz, Tahar Nabil|arXiv (Cornell University)|Dec 17, 2020
Building Energy and Comfort Optimization参考文献 17被引用数 4
ひとこと要約

本稿では、中国の二次ネットワークにおける街区暖房供給水温を最適化するための深層強化学習(DRL)手法を提案している。再帰的ニューラルネットワーク(RNN)を用いて室内温度を予測し、DRLエージェントの学習に用いる。エージェントは最適化されたベースラインと比較して、1シーズンあたり2.19%のエネルギー削減と495トンのCO₂削減を達成するとともに、熱的快適性を向上させた。

ABSTRACT

Achieving efficiency gains in Chinese district heating networks, thereby reducing their carbon footprint, requires new optimal control methods going beyond current industry tools. Focusing on the secondary network, we propose a data-driven deep reinforcement learning (DRL) approach to address this task. We build a recurrent neural network, trained on simulated data, to predict the indoor temperatures. This model is then used to train two DRL agents, with or without expert guidance, for the optimal control of the supply water temperature. Our tests in a multi-apartment setting show that both agents can ensure a higher thermal comfort and at the same time a smaller energy cost, compared to an optimized baseline strategy.

研究の動機と目的

  • 中国の街区暖房ネットワークにおけるエネルギー非効率性を是正すること。これは、古くなった制御戦略が二酸化炭素排出の主な要因であるためである。
  • データ駆動型の最適制御手法を二次ネットワークの温度制御に開発し、熱的快適性を向上させるとともにエネルギー消費を削減すること。
  • 深層強化学習が、実世界に類似したシミュレーションにおいて、従来の水温曲線に基づく制御戦略を上回ることを評価すること。
  • 熟練者によるガイド付き行動空間がDRLエージェントの性能および実装可能性に与える影響を評価すること。
  • エネルギーコストの重み付けを明示的に設けないにもかかわらず、熱的快適性の偏差に基づく報酬関数がエネルギー消費の削減をもたらすかどうかを示すこと。

提案手法

  • 再帰的ニューラルネットワーク(RNN)を、供給水温、外気温、時間帯、および歴史的測定値に基づいて室内温度を予測する目的でシミュレートされたデータで学習する。
  • Deep Q-Networks(DQN)を用いて2つのDRLエージェントを学習する。エージェント1は直前の供給水温からの増分的行動を使用する。エージェント2は学習されたベースライン戦略からの偏差を使用する。
  • 環境をマルコフ決定過程としてモデル化し、外気温、供給水温、時間帯、および24時間の履歴にわたる室内温度を含む状態ベクトルを用いる。
  • 報酬関数は、ターゲット室内温度(18 °C)からの絶対偏差をペナルティとして課し、エネルギーコストの重み付けは明示的に設けない:r = -Σ|T_in - T_target|。
  • 過学習を回避するため、7つの中国都市の気象データを用いて学習を行い、一般化性能を評価する目的で8番目の都市(運城)でテストを実施する。
  • ベースライン戦略は最適化された水温曲線であり、手動でチューニングされており、現在の産業実務を反映している。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、中国の街区暖房システムにおいて、エネルギー効率性と熱的快適性の観点で、現在の産業標準の水温曲線戦略を上回ることができるか?
  • RQ2熟練者によるガイド付き行動空間(エージェント2)は、実世界の展開シナリオにおけるDRLエージェントの性能と安定性にどのように影響するか?
  • RQ3エネルギーコストペナルティを明示的に設けないにもかかわらず、熱的快適性の偏差に基づく報酬関数が、エネルギー消費の削減にどの程度寄与できるか?
  • RQ4RNNに基づく温度予測モデルは、異なる気候条件においてDRLエージェントの頑健性と一般化性能をどの程度向上させるか?
  • RQ5100万平方メートルをカバーする大規模な街区暖房ネットワークにDRLを適用した場合、CO₂およびエネルギーの削減見込みはどの程度か?

主な発見

  • エージェント2は、マルチアパートメントシミュレーションにおいて、最適化されたベースライン戦略と比較して、1シーズンあたり2.19%のエネルギー削減と495トンのCO₂削減を達成した。
  • 両エージェントとも、ベースラインと比較して室内温度の平均絶対誤差を8.5%削減した。エージェント2は最小誤差(0.545 °C)と最小標準偏差(0.692 °C)を達成した。
  • エネルギーコストの重み付けを明示的に設けないにもかかわらず、熱的快適性の偏差に基づく報酬関数は、トレードオフ関数よりも安定性と頑健性に優れ、顕著なエネルギー削減を実現した。
  • 熟練者によるガイド付き行動空間(エージェント2)は、性能を向上させるとともに、行動が熟練者ベースラインから3 °C以内に収まるように保証し、運用者の信頼性と実装可能性を高めた。
  • PID制御はベースラインよりもわずかに優れていたが、エネルギー効率性および熱的快適性の両面で、両DRLエージェントに劣った。
  • 結果から、DRLは、固定された熱料金と蓄熱機能のない低柔軟性環境であっても、街区暖房システムの複雑な熱的ダイナミクスを効果的に学習できることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。