Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Demand Response Using Device Based Reinforcement Learning

Zheng Wen, Daniel O’Neill|arXiv (Cornell University)|Jan 8, 2014
Smart Grid Energy Management参考文献 18被引用数 6
ひとこと要約

本稿では、住宅および小規模商業施設における最適需給応答を実現するデバイスベースの強化学習(RL)フレームワークを提案する。ユーザー不満関数を事前に指定する必要がなく、デバイスクラスタを対象とした分散型RL問題としてエネルギー管理システム(EMS)を定式化することで、自己主導のジョブスケジューリングと柔軟なユーザー要請を可能にした。計算量は線形に増加し、さまざまなコスト遅延トレードオフにおけるQ学習シミュレーションを通じて優れた性能を示した。

ABSTRACT

Demand response (DR) for residential and small commercial buildings is estimated to account for as much as 65% of the total energy savings potential of DR, and previous work shows that a fully automated Energy Management System (EMS) is a necessary prerequisite to DR in these areas. In this paper, we propose a novel EMS formulation for DR problems in these sectors. Specifically, we formulate a fully automated EMS's rescheduling problem as a reinforcement learning (RL) problem, and argue that this RL problem can be approximately solved by decomposing it over device clusters. Compared with existing formulations, our new formulation (1) does not require explicitly modeling the user's dissatisfaction on job rescheduling, (2) enables the EMS to self-initiate jobs, (3) allows the user to initiate more flexible requests and (4) has a computational complexity linear in the number of devices. We also demonstrate the simulation results of applying Q-learning, one of the most popular and classical RL algorithms, to a representative example.

研究の動機と目的

  • 手動意思決定による意思決定の疲労や参加率の低さに起因する、住宅および小規模商業施設における需給応答の自動化の課題に対処すること。
  • 過去の研究における主な制限要因である、ジョブ再スケジューリングにおけるユーザー不満を明示的にモデル化する必要を排除すること。
  • 自己主導のジョブ(例:HVAC、プールヒーター)と柔軟なユーザー要請をサポートするEMSの定式化を実現すること。
  • デバイス数に比例する線形計算複雑度を達成し、スケーラビリティを確保すること。
  • 代表的な合成例を用いたQ学習による、提案されたRLベースのEMSの実現可能性と性能を示すこと。

提案手法

  • デバイスクラスタ上での分散型マーカフ・決定過程(MDP)としてEMSの再スケジューリング問題を定式化する。
  • グローバルなRL問題をデバイスクラスタレベルの意思決定に分解することで、複雑度を低減し、スケーラビリティを向上させる。
  • エネルギー価格とユーザー要請との相互作用から最適スケジューリング方策を学習するため、Q学習を主なRLアルゴリズムとして用いる。
  • ユーザー要請を優先度に依存しない時刻依存のキャンセル確率を持つ確率的イベントとしてモデル化する。
  • 異なるコスト遅延トレードオフパラメータ(γ)におけるシステム性能を評価するため、相対的需給応答ポテンシャル(RDRP)を定義する。
  • 訓練中の探索と活用のバランスを図るため、温度パラメータηと探索率εを用いたソフトミン方策を実装する。

実験結果

リサーチクエスチョン

  • RQ1ジョブ再スケジューリングにおけるユーザー不満関数の明示的モデル化を必要としない完全自動化されたEMSを設計できるか?
  • RQ2本稿で提案するデバイスベースのRL定式化は、常にジョブを再スケジューリングしないベースライン方策と比較して、どのように性能を発揮するか?
  • RQ3コスト遅延トレードオフパラメータγを変化させた場合、システムの相対的改善(RI)にどのような影響を与えるか?
  • RQ4明示的なユーザー要請がなくてもEMSは自己主導のジョブスケジューリングを学習できるか?また、これによりエネルギー費用とユーザー遅延にどのような影響があるか?
  • RQ5本手法はデバイス数の増加に伴い、線形計算複雑度を維持して効率的にスケーリングできるか?

主な発見

  • 提案されたRLベースのEMSは、γ ≤ 4.3の範囲で、さまざまなコスト遅延トレードオフパラメータにおいて、ベースライン方策(再スケジューリングなし)を常に上回る性能を示し、相対的改善(RI)が一貫して正値を示した。
  • 相対的需給応答ポテンシャル(RDRP)は、γが増加するにつれて単調に減少し、再スケジューリングを避ける傾向が強いほど、システムの利得達成能力が低下することを示している。
  • γ = 0のときRDRP = 1であり、γ → ∞に近づくとRDRPは0に近づくため、モデルの理論的境界が確認された。
  • シミュレーション結果から、Q学習が最適スケジューリング方策を効果的に学習していることが示され、γが増加するにつれてRIが減少し、再スケジューリングの柔軟性が低下していることが反映された。
  • 本手法はデバイスクラスタ数に比例する線形計算複雑度を達成しており、実世界への展開に適したスケーラビリティを有している。
  • フレームワークは自己主導のジョブスケジューリングを可能にするとともに、柔軟なユーザー要請をサポートし、従来の手法の主な限界を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。