Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Tropical Air Free-Cooled Data Center Control

Duc Van Le, Rongrong Wang|arXiv (Cornell University)|Dec 12, 2020
Reinforcement Learning in Robotics参考文献 29被引用数 8
ひとこと要約

本論文は、熱帯のエアフリーコールドデータセンターにおける供給風温および相対湿度(RH)制御を最適化するため、制約付き深層強化学習(cDRL)フレームワークを提案する。冷却エネルギーを最小限に抑えつつサーバの安全性を確保する。実際のシンガポールのテストベッドからのデータを用いて、厳格なRHおよび温度制約下で最大25%の冷却エネルギー削減を達成し、非制約付きDRLおよび従来のヒステリシスベースの制御を上回る性能を示した。

ABSTRACT

Air free-cooled data centers (DCs) have not existed in the tropical zone due to the unique challenges of year-round high ambient temperature and relative humidity (RH). The increasing availability of servers that can tolerate higher temperatures and RH due to the regulatory bodies' prompts to raise DC temperature setpoints sheds light upon the feasibility of air free-cooled DCs in tropics. However, due to the complex psychrometric dynamics, operating the air free-cooled DC in tropics generally requires adaptive control of supply air condition to maintain the computing performance and reliability of the servers. This paper studies the problem of controlling the supply air temperature and RH in a free-cooled tropical DC below certain thresholds. To achieve the goal, we formulate the control problem as Markov decision processes and apply deep reinforcement learning (DRL) to learn the control policy that minimizes the cooling energy while satisfying the requirements on the supply air temperature and RH. We also develop a constrained DRL solution for performance improvements. Extensive evaluation based on real data traces collected from an air free-cooled testbed and comparisons among the unconstrained and constrained DRL approaches as well as two other baseline approaches show the superior performance of our proposed solutions.

研究の動機と目的

  • 年間を通じて高温・高湿度が続く熱帯気候におけるエアフリーコールドデータセンターの運用課題に対処すること。
  • サーバの性能と信頼性を確保するため、供給風温およびRHを安全なしきい値(例:≤37°C、≤65% RH)の範囲に制御すること。
  • 空気混合および温度制御の適応的・リアルタイム制御を通じて、冷却エネルギー消費量を最小限に抑えること。
  • 訓練中に物理的制約(温度およびRH)を強制する制約付き深層強化学習(cDRL)手法の開発および評価すること。

提案手法

  • 室外および室内温度、RH、サーバ負荷、および供給風状態を含む状態空間を有するマルコフ意思決定過程(MDP)として空気制御問題を定式化する。
  • 深層Qネットワーク(DQN)を用いて、環境状態から行動(例:ファン回転数、冷却コイル出力、ミキシングバルブ位置)への制御方策を学習する。
  • 供給風温およびRHに硬い制約を課すために報酬関数にペナルティ項を組み込んだ制約付きDRLフレームワークを導入する。
  • シンガポールの200以上のセンサーを備えたテストベッドから得た実世界のデータトレースを用いて、現実の気象およびワークロード変動下でのDRL方策の訓練および検証を行う。
  • シミュレーションにおいて、cDRL手法を非制約付きDRL(uDRL)ベースラインおよび従来のヒステリシスベースの制御方策と比較する。
  • 熱いリターンエアーの制御された一部を再循環させ、外部空気をサーバに供給する前に処理するハイブリッド空気ミキシング戦略を実装する。
(a) 3D view.
(a) 3D view.

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、エネルギー消費を最小限に抑えつつ、熱帯のエアフリーコールドデータセンターにおける供給風温および相対湿度を効果的に制御できるか?
  • RQ2制約付きDRLは、非制約付きDRLおよび従来のヒステリシス制御と比較して、温度およびRHを安全なしきい値内に維持する上でどのように優れているか?
  • RQ3温度およびRHの制約を変化させた場合(例:32°C/65%、35°C/70%)に、冷却エネルギー消費量および制御安定性にどのような影響を与えるか?
  • RQ4物理的テストベッドからの実世界のデータトレースは、DRL方策の一般化および耐障害性をどの程度向上させるか?
  • RQ5動的な熱帯気象条件下において、cDRL手法はuDRLおよびベースライン手法と比較して制約違反(例:RH > 65%)をどの程度低減できるか?

主な発見

  • 制約付きDRL(cDRL)手法は、厳密な制約(例:32°C/65% RH)下で、平均冷却電力消費量が最も低く、ヒステリシスベースのベースラインと比較して最大25%低い結果を達成した。
  • cDRLは、すべてのテストシナリオにおいて供給風温およびRHを必要なしきい値以下に維持し、非制約付きDRL(uDRL)手法と比較して著しく少ない違反を示した。
  • 緩い制約(例:40°C/80% RH)下でも、cDRLはヒステリシスベースの方法と比較して20–25%の冷却エネルギー削減を達成しながら、安全マージンを確保した。
  • uDRL手法は、特に厳しいしきい値下で、温度およびRHの変動が大きかったため、制御がより不安定であった。
  • ヒステリシスベースの手法は、外部条件が設定値を逸脱した場合に、DRL手法と比較して一貫して高いエネルギー消費量を示した。
  • 実世界のテストベッドデータは、サーバが供給風温37°Cまで完全な計算性能を維持できることを確認し、熱帯地域におけるフリーコールドの実現可能性を裏付けた。
(b) Top view.
(b) Top view.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。