Skip to main content
QUICK REVIEW

[論文レビュー] Flow Rate Control in Smart District Heating Systems Using Deep Reinforcement Learning

Tinghao Zhang, Luo Jing|arXiv (Cornell University)|Dec 1, 2019
Smart Grid Energy Management参考文献 39被引用数 6
ひとこと要約

本稿では、Deep Deterministic Policy Gradient (DDPG) を用いて、スマート街区暖房システムにおける流量制御を最適化する深層強化学習(DRL)ベースの制御システムを提案する。本手法は、手動制御と比較して、エネルギー消費を 19,850.1 GJ/h、水消費を 42,276.45 トン/h 減少させ、実環境およびシミュレーション環境での実装において顕著な効率向上を示した。

ABSTRACT

At high latitudes, many cities adopt a centralized heating system to improve the energy generation efficiency and to reduce pollution. In multi-tier systems, so-called district heating, there are a few efficient approaches for the flow rate control during the heating process. In this paper, we describe the theoretical methods to solve this problem by deep reinforcement learning and propose a cloud-based heating control system for implementation. A real-world case study shows the effectiveness and practicability of the proposed system controlled by humans, and the simulated experiments for deep reinforcement learning show about 1985.01 gigajoules of heat quantity and 42276.45 tons of water are saved per hour compared with manual control.

研究の動機と目的

  • 最適でない流量制御と高い水の浪費が原因で生じる街区暖房システム(DHS)の非効率性を是正すること。
  • 複雑な数学的モデルに依存するか、多様なDHS構成に適応できない従来の制御手法の限界を克服すること。
  • 深層強化学習(DRL)を用いたスケーラブルでクラウドベースの制御システムを構築し、リアルタイムで自動化された流量最適化を実現すること。
  • 実環境での実装とシミュレーションを用いてDRLアプローチを検証し、手動制御に比べてエネルギーと水の節約が達成されることを示すこと。

提案手法

  • 深層強化学習(DRL)の Deep Deterministic Policy Gradient (DDPG) アルゴリズムを用いて、街区暖房システムの一次側および二次側における最適な流量ポリシーを学習するための深層ニューラルネットワークを訓練する。
  • DRLエージェントは、給水温度・還水温度・流量・目標熱負荷などの状態観測値を入力とし、実際の熱供給量と目標値のずれを最小化するように流量調整量を出力する。
  • 変化するシステムダイナミクスに適応するため、新しいデータ(例:7日間のローリングウィンドウ)を用いて段階的に再訓練するローリングトレーニング手法を採用する。
  • 現場のセンサーからクラウドプラットフォーム(アリババクラウド)へのリアルタイムデータ送信を実現するため、NB-IoTを統合し、遠隔集中制御を可能にする。
  • DRLによる主要な流量制御と、個々の住宅における水力的アンバランスを補正するためのPID制御を組み合わせたハイブリッド制御アーキテクチャを採用する。
  • 報酬関数は、一次側および二次側における実際の熱量と目標熱量の絶対誤差を最小化するように設計されている。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、エネルギーおよび水の消費を削減することを目的とした街区暖房システムにおける流量制御を効果的に最適化できるか?
  • RQ2DRLベースの制御は、熱供給の正確性とリソース効率の観点で、手動制御に比べてどのように異なるか?
  • RQ3詳細なシステム固有の数学的モデルを必要とせずに、DRLエージェントは多様な街区暖房システム構成に一般化できるか?
  • RQ4NB-IoTを用いたリアルタイムデータストリーミングは、実環境でのDRLベース制御の性能とスケーラビリティにどのような影響を与えるか?
  • RQ5ローリングトレーニング戦略は、変動する暖房環境におけるモデルの安定性と適応性をどのように向上させるか?

主な発見

  • DDPGエージェントは、手動制御と比較して、二次側で総熱エネルギー消費量を 12.6%、一次側で 9.7% 減少させた。
  • DDPG手法は、テストされた手法の中で2番目に低い値となる正規化済み総熱消費量 18,219.17 GJ/h を達成し、CE値が 1,307.07 GJ/h と高い効率性を示した。
  • DDPGおよびSACエージェントは、教師あり学習手法よりも目標曲線に近い熱供給を維持しており、周波数分布ヒストグラムにおいて誤差がゼロ付近に集中していることが確認された。
  • シミュレーション実験において、DRLベースのシステムは、手動制御と比較して、1時間あたり約 19,850.1 ギガジュールの熱エネルギーと 42,276.45 トンの水を節約した。
  • ローリングトレーニング戦略により、DRLモデルは時間経過とともに改善し、より多くのデータが組み込まれるにつれて平均報酬が上昇した。これは、実環境のダイナミクスに効果的に適応していることを示している。
  • DRLベースのシステムは、複雑で非線形なダイナミクスおよび水力的アンバランスに対処する能力に優れ、従来の制御手法に比べて正確性と安定性の両面で優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。