Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Optimal Control of HVAC system for Energy-efficient Buildings

Yu Yang, Guoqiang Hu|arXiv (Cornell University)|2019. 11. 03.
Building Energy and Comfort Optimization참고 문헌 29인용 수 6
한 줄 요약

이 논문은 기상 및 점유자 수의 불확실성을 고려하여 에너지 효율성과 열적 쾌적함을 균형 잡는 데 사용되는 마코프 결정 과정(MDP)과 기울기 기반 학습(GB-L) 방법을 활용한 확률적 최적 제어 프레임워크를 제안한다. 이 방법은 이상적인 미래 지식을 가진 모델 예측 제어(MPC)에 비해 에너지 비용이 6.5% 증가했음에도 불구하고, 1초 이내의 온라인 계산 시간과 높은 열적 쾌적함 확률을 달성하여 근사 최적 성능을 이룬다.

ABSTRACT

The heating, ventilation and air-conditioning (HVAC) system accounts for substantial energy use in buildings, whereas a large group of occupants are still not actually feeling comfortable staying inside. This poses the issue of developing energy-efficient HVAC control, i.e., reduce energy use (cost) while simultaneously enhancing human comfort. This paper pursues the objective and studies the stochastic optimal HVAC control subject to uncertain thermal demand (i.e., the weather and occupancy etc). Particularly, we involve the elaborate predicted mean vote (PMV) thermal comfort model in the optimization. The problem is computationally challenging due to the non-linear and non-analytical constraints imposed by the system dynamics and PMV model. We make the following contributions to address it. First, we formulate the problem as a Markov decision process (MDP) which is a desirable modeling technique capable of handling the complexities. Second, we propose a gradient-based learning (GB-L) method for progressively learning a stochastic control policy off-line and store it for on-line execution. Third, we prove the learning method converge to the optimal policies theoretically, and its performance (i.e., energy cost, thermal comfort and on-line computation) for HVAC control via simulations. The comparisons with the existing model predictive control based relaxation (MPC-R) method which is assumed with accurate future information and supposed to provide the near-optimal bounds, show that though there exists some performance loss in energy cost reduction (i.e., 6.5%), the proposed method can enable efficient on-line implementation (less than 1 second) and provide high probability of thermal comfort under uncertainties.

연구 동기 및 목표

  • 기상 및 점유자 수에서 기인하는 열적 수요의 불확실성 하에서 HVAC 시스템의 에너지 효율성과 점유자 열적 쾌적함을 균형 잡는 문제에 대응한다.
  • 비선형 동역학과 복잡한 제약 조건을 다룰 수 있도록 HVAC 제어를 마코프 결정 과정(MDP)으로 공식화한다.
  • 빠른 온라인 실행을 가능하게 하는 오프라인 정책 학습을 위한 기울기 기반 학습(GB-L) 방법을 개발한다.
  • 학습된 제어 정책의 전역 최적성에 대한 이론적 수렴을 보장한다.
  • 기상 및 점유자 수의 변동성과 같은 실제 불확실성 하에서도 높은 열적 쾌적함 확률과 낮은 온라인 계산 시간을 확보한 강건한 성능을 입증한다.

제안 방법

  • 상태, 행동, 보상 함수를 갖춘 마코프 결정 과정(MDP)으로 HVAC 시스템을 모델링하여 확률적 동역학과 열적 쾌적함 제약 조건을 포괄한다.
  • 열적 쾌적함을 정량화하기 위해 MDP 프레임워크 내부에 비분석적이고 비선형적인 예측 평균 쾌적도(PMV) 모델을 통합한다.
  • 정책 기울기 추정을 사용하여 반복적으로 확률적 제어 정책을 업데이트하는 기울기 기반 정책 개선(GBPI) 알고리즘을 제안한다.
  • softmax 행동 선택을 통해 탐색을 가능하게 하고 기울기를 활용해 정책 최적화를 수행할 수 있는 파arameterized 확률적 정책을 사용한다.
  • 정책 기울기 정리에서 유도된 성능 기울기 업데이트 규칙을 적용하여 최적 정책로의 수렴을 보장한다.
  • GB-L 방법은 오프라인으로 학습되고 온라인으로 구현되어 밀리초 수준의 반응 시간을 확보한 실시간 제어를 가능하게 한다.

실험 결과

연구 질문

  • RQ1불확실한 열적 교란 하에서 에너지 소비와 열적 쾌적함을 효과적으로 균형 잡는 데 있어 확률적 최적 제어 프레임워크가 유용한가?
  • RQ2완벽한 미래 지식을 가진 이상화된 모델 예측 제어(MPC-R)에 비해 제안된 기울기 기반 학습 방법은 에너지 비용과 쾌적함 측면에서 어떻게 비교되는가?
  • RQ3HVAC 시스템과 PMV 모델의 비볼록성 및 비선형성 제약 조건에도 불구하고 GB-L 방법은 전역 최적 정책으로 수렴하는가?
  • RQ4제안된 방법에서 에너지 비용 절감과 온라인 계산 효율성 사이의 상충 관계는 어떠한가?
  • RQ5기상 및 점유자 수의 변동성과 같은 실제 불확실성 하에서도 이 방법은 높은 열적 쾌적함 확률을 보장할 수 있는가?

주요 결과

  • 제안된 GB-L 방법은 이상적인 MPC-R 기준선(완벽한 미래 정보를 가정)에 비해 에너지 비용이 오직 6.5% 증가했음에도 불구하고 근사 최적 성능을 달성한다.
  • 이 방법은 제어 단계당 1초 이내로 온라인 구현이 가능하여 실시간 구현에 적합하다.
  • 이론적 분석을 통해 제시된 MDP 공식화 하에서 GB-L 방법이 전역 최적 정책으로 수렴한다는 것을 입증한다.
  • 이 방법은 불확실성 하에서도 높은 열적 쾌적함 확률을 보장하여 기존 제어 전략보다 점유자 만족도를 더 잘 유지한다.
  • 시뮬레이션 결과는 MDP 프레임워크 내부에 PMV 모델을 통합함으로써 에너지 사용과 열적 쾌적함을 효과적으로 균형 잡는 데 성공했다는 것을 확인한다.
  • 기울기 기반 정책 업데이트 메커니즘은 HVAC 시스템과 PMV 모델의 비볼록성 및 비분석적 제약 조건을 효과적으로 탐색한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.