Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning Testbed for Power-Consumption Optimization

Takao Moriyama, Giovanni De Magistris|arXiv (Cornell University)|Aug 21, 2018
Heat Transfer and Optimization参考文献 12被引用 13
一句话总结

本论文提出了一种基于深度强化学习(DRL)的控制器,用于数据中心冷却系统,采用开源EnergyPlus仿真测试平台,取代传统的基于模型的控制方法。通过优化一个平衡功耗与温度稳定性的奖励函数,DRL智能体在保持安全温度范围的同时,实现了比内置控制器低22%的功耗。

ABSTRACT

Common approaches to control a data-center cooling system rely on approximated system/environment models that are built upon the knowledge of mechanical cooling and electrical and thermal management. These models are difficult to design and often lead to suboptimal or unstable performance. In this paper, we show how deep reinforcement learning techniques can be used to control the cooling system of a simulated data center. In contrast to common control algorithms, those based on reinforcement learning techniques can optimize a system's performance automatically without the need of explicit model knowledge. Instead, only a reward signal needs to be designed. We evaluated the proposed algorithm on the open source simulation platform EnergyPlus. The experimental results indicate that we can achieve 22% improvement compared to a model-based control algorithm built into the EnergyPlus. To encourage the reproduction of our work as well as future research, we have also publicly released an open-source EnergyPlus wrapper interface directly compatible with existing reinforcement learning frameworks.

研究动机与目标

  • 解决数据中心冷却系统中基于模型控制的低效与复杂性问题。
  • 开发一种数据驱动的、无需模型的控制方法,利用深度强化学习(DRL)学习最优设定点策略,而无需依赖显式系统模型。
  • 通过最小化功耗并维持热约束,提升数据中心的能源效率。
  • 发布一个公开可用的、与Gym兼容的DRL环境,用于EnergyPlus,以支持可复现性与未来研究。

提出的方法

  • 作者开发了一个开源的仿真封装工具EnergyPlusEnv,兼容OpenAI Gym接口,使DRL智能体能够与EnergyPlus仿真系统交互。
  • DRL智能体使用信任域策略优化(TRPO)算法,学习调整冷却组件(如DX盘管、冷却水盘管和风扇)的设定温度的控制策略。
  • 环境暴露了包括区域温度、室外气象条件和功耗在内的状态变量,并根据功耗使用情况和温度偏差惩罚提供奖励信号。
  • 奖励函数被设计为惩罚高功耗和超出可接受范围[22.0 °C, 25.0 °C]的温度,以鼓励能效提升与热稳定性。
  • 系统在多个气象数据集(CA、CO、FL)上进行训练,并在不同气候条件下进行评估,以检验泛化能力。
  • DRL智能体取代了内置的设定点管理器和VAV风机控制器,实现了冷却策略的端到端学习。

实验结果

研究问题

  • RQ1深度强化学习能否在降低数据中心冷却功耗方面优于传统基于模型的控制?
  • RQ2DRL控制器在不同气象条件和气候区域下的性能如何实现泛化?
  • RQ3DRL智能体在不依赖系统模型的情况下,能在多大程度上维持热稳定性并最小化能耗?
  • RQ4公开发布的、与Gym兼容的仿真环境能否支持数据中心能效优化研究的可复现性与可扩展性?

主要发现

  • 与基线基于模型的控制器相比,DRL控制器在五个测试气象数据集上实现了平均22.1%的功耗降低。
  • 在CA-CO-FL气象数据组合上训练的TRPO智能体,平均功耗降至98.3 kW,而基线为126.2 kW。
  • DRL智能体的温度控制显著更稳定:标准差降至0.28 °C(基线为0.40 °C),且99.6%的读数位于[22.0 °C, 25.0 °C]范围内。
  • DRL控制器在包括炎热(FL)和寒冷(CO)地区的多种气候条件下均保持一致的高性能,且在所有测试条件下均优于基线。
  • 开源的EnergyPlus封装工具已成功发布于GitHub,支持与现有DRL框架集成,推动未来研究。
  • 结果表明,DRL可在无需详细系统模型的情况下,有效优化复杂的真实世界HVAC系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。