Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Deep Reinforcement Learning for HVAC Control in Commercial Buildings

Liang Yu, Yi Sun|arXiv (Cornell University)|2020. 06. 25.
Building Energy and Comfort Optimization참고 문헌 39인용 수 4
한 줄 요약

이 논문은 열역학적 동역학이나 불확실한 파ameter에 대한 사전 지식이 없이도 다중지점 상업용 건물의 HVAC 에너지 비용을 최소화하기 위해 주목기반 다중에이전트 강화학습(MADRL) 알고리즘을 제안한다. 실제 점유율과 전기 요금 변동 조건에서 기준 방법 대비 총 에너지 비용을 75.25% 낮추며, 높은 효과성, 강건성 및 확장성을 입증한다.

ABSTRACT

In commercial buildings, about 40%-50% of the total electricity consumption is attributed to Heating, Ventilation, and Air Conditioning (HVAC) systems, which places an economic burden on building operators. In this paper, we intend to minimize the energy cost of an HVAC system in a multi-zone commercial building under dynamic pricing with the consideration of random zone occupancy, thermal comfort, and indoor air quality comfort. Due to the existence of unknown thermal dynamics models, parameter uncertainties (e.g., outdoor temperature, electricity price, and number of occupants), spatially and temporally coupled constraints associated with indoor temperature and CO2 concentration, a large discrete solution space, and a non-convex and non-separable objective function, it is very challenging to achieve the above aim. To this end, the above energy cost minimization problem is reformulated as a Markov game. Then, an HVAC control algorithm is proposed to solve the Markov game based on multi-agent deep reinforcement learning with attention mechanism. The proposed algorithm does not require any prior knowledge of uncertain parameters and can operate without knowing building thermal dynamics models. Simulation results based on real-world traces show the effectiveness, robustness and scalability of the proposed algorithm.

연구 동기 및 목표

  • 상업용 건물의 HVAC 시스템이 전체 전기 사용량의 40%-50%를 차지하는 높은 에너지 비용 문제를 해결한다.
  • 임의의 점유율, 변동 전기 요금, 실내 공기질 제약 조건 등 불확실하고 동적인 조건에서 HVAC 에너지 비용을 최소화하는 도전 과제를 해결한다.
  • 건물의 열역학적 동역학 모델이나 외기 온도, 점유율 수준 등 불확실한 파ameter에 대한 사전 지식 없이도 작동하는 제어 알고리즘을 개발한다.
  • 복잡하고 상호연결된 환경에서 열적 편안함과 실내 공기질 편안함을 유지하면서도 시스템의 확장성과 강건성을 확보한다.

제안 방법

  • 다중지점 간 상호작용과 제약 조건을 모델링하기 위해 HVAC 제어 문제를 마르코프 게임로 재정의한다.
  • 지역 간 협동 의사결정을 가능하게 하기 위해 주목기반 다중에이전트 딥 강화학습 프레임워크를 설계한다.
  • 비凸성 및 비분리 가능한 환경에서 탐색과 안정적 학습이 가능한 소프트 액터-크리틱(SAC) 알고리즘을 사용해 학습한다.
  • 지역 온도, CO₂ 농도, 점유율, 외기 온도, 전기 요금을 포함한 상태 표현을 통합한다.
  • 고차원 행동 공간(예: 30개 지점에 대해 11^31가지 행동)에서의 학습을 지원하기 위해 대용량 경험 재생 버퍼를 구현한다.
  • 모델 지식 없이도 동적이고 불확실한 조건에 적응할 수 있도록 실제 건물의 트레이서를 사용해 에이전트를 종합적으로 학습시킨다.

실험 결과

연구 질문

  • RQ1열역학적 동역학 모델에 의존하지 않고도 다중지점 상업용 건물의 HVAC 에너지 비용을 효과적으로 최소화할 수 있는 다중에이전트 딥 강화학습 접근법이 가능한가?
  • RQ2제안된 알고리즘이 외기 온도 및 전기 요금과 같은 불확실한 파ameter와 임의의 지점 점유율 조건에서 어떻게 성능을 발휘하는가?
  • RQ3주목기반 메커니즘이 공간적·시간적으로 연결된 HVAC 제어에서 에이전트 간 협동을 얼마나 향상시키는가?
  • RQ4알고리즘이 열역학적 동역학의 모델 불확실성과 외란에 대해 얼마나 강건한가?
  • RQ5지점 수가 증가할 경우 알고리즘의 확장성은 어느 정도인가?

주요 결과

  • 실제 조건에서 랜덤 서치(RS) 기준 대비 총 에너지 비용(Total Energy Cost, TEC)을 75.25% 감소시켰다.
  • 히우리스틱 전략(HS) 대비 TEC를 56.50% 감소시켜 비용 최소화 측면에서 뛰어난 성능을 보였다.
  • 임의의 외란 상황 3가지에서 강건성을 유지하였으며, 평균 절대 온도 편차(ATD) ≤1.4°C 및 평균 CO₂ 편차(ACD) ≤40 ppm를 확보하였다.
  • 20,000개의 학습 에피소드 동안 수렴이 안정되었으며, 평균 에피소드 보상이 시간이 지남에 따라 증가하고 안정화되어 효과적인 학습이 이루어졌음을 나타냈다.
  • 30개 지점까지 효과적으로 확장되었으며, 11^31의 큰 행동 공간을 가진 고차원 제어 과제에서도 성능을 유지하였다.
  • 주목기반 메커니즘이 에이전트 간 효과적인 협동을 가능하게 하여 고가격 기간 동안 총 공기 공급률을 감소시켜 에너지 절감에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.