Skip to main content
QUICK REVIEW

[논문 리뷰] Experimental analysis of data-driven control for a building heating system

Giuseppe Tommaso Costanzo, Sandro Iacovella|arXiv (Cornell University)|2015. 07. 13.
Building Energy and Comfort Optimization참고 문헌 10인용 수 4
한 줄 요약

이 논문은 동적 요금제 하에서 건물 난방 제어를 최적화하기 위해 모델 보조 배치 강화학습, 특히 가상 지지 튜플을 활용한 적응형 Q-반복과 도메인 지식 형태화를 사용하는 데이터 기반 제어 접근법을 제안한다. 시뮬레이션에서 20일 이내로 근사 최적 성능에 도달하며, 다양한 외기 온도 조건에서 실생활 실험실 환경에서도 실용적이고 사용 가능한 정책을 입증한다.

ABSTRACT

Driven by the opportunity to harvest the flexibility related to building climate control for demand response applications, this work presents a data-driven control approach building upon recent advancements in reinforcement learning. More specifically, model assisted batch reinforcement learning is applied to the setting of building climate control subjected to a dynamic pricing. The underlying sequential decision making problem is cast on a markov decision problem, after which the control algorithm is detailed. In this work, fitted Q-iteration is used to construct a policy from a batch of experimental tuples. In those regions of the state space where the experimental sample density is low, virtual support samples are added using an artificial neural network. Finally, the resulting policy is shaped using domain knowledge. The control approach has been evaluated quantitatively using a simulation and qualitatively in a living lab. From the quantitative analysis it has been found that the control approach converges in approximately 20 days to obtain a control policy with a performance within 90% of the mathematical optimum. The experimental analysis confirms that within 10 to 20 days sensible policies are obtained that can be used for different outside temperature regimes.

연구 동기 및 목표

  • 건물 난방 시스템을 위한 데이터 기반 제어 전략을 개발하여 수요 반응 응용에 활용한다.
  • 건물 기후 제어에서 희박한 데이터 문제를 해결하기 위해 신경망을 활용해 실험적 튜플을 가상 샘플로 보완한다.
  • 학습된 제어 정책에 도메인 지식을 통합하여 정책 성능을 향상시킨다.
  • 시뮬레이션을 통한 정량적 평가와 실생활 생활 실험실 환경에서의 정성적 평가를 통해 방법을 검증한다.
  • 동적 전기 요금제 하에서 근사 최적 성능로 수렴하는가를 확인한다.

제안 방법

  • 건물 기후 제어의 순차적 의사결정을 모델링하기 위해 제어 문제를 마르코프 결정 과정(MDP)으로 공식화한다.
  • 건물 시스템에서 수집한 실험 데이터 튜플의 배치로부터 제어 정책을 학습하기 위해 적응형 Q-반복을 적용한다.
  • 상태 공간의 낮은 데이터 영역에서는 인공 신경망을 사용해 가상 지지 튜플을 생성하여 정책 일반화 능력을 향상시킨다.
  • 결과로 도출된 정책은 도메인 지식을 활용해 보다 강건하고 실용적으로 개선된다.
  • 이 방법은 시뮬레이션과 실생활 생활 실험실 환경에서의 테스트를 통해 검증된다.
  • 에너지 비용 절감을 유도하기 위해 동적 전기 요금제를 보상 신호로 사용한다.

실험 결과

연구 질문

  • RQ1건물 난방 시스템에서 제한된 실험 데이터로부터 데이터 기반 제어 정책을 효율적으로 학습할 수 있는가?
  • RQ2신경망을 통한 가상 지지 튜플의 포함이 낮은 샘플링 영역에서 정책 성능에 어떤 영향을 미치는가?
  • RQ3도메인 지식을 통합함으로써 학습된 강화학습 정책의 실용성과 강건성은 어느 정도 향상되는가?
  • RQ4동적 요금제 하에서 제어 정책이 근사 최적 성능으로 수렴하는 데 얼마나 빠른가?
  • RQ5실생활 조건에서 다양한 외기 온도 환경으로 정책이 일반화되는가?

주요 결과

  • 데이터 기반 제어 접근법은 시뮬레이션에서 약 20일간의 훈련 동안 수학적 최적값의 90퍼센트 내외의 성능에 수렴한다.
  • 생활 실험실에서 10~20일 이내로 타당하고 사용 가능한 제어 정책을 확보하였으며, 다양한 외기 온도 조건에 적용 가능했다.
  • 신경망을 통한 가상 지지 튜플 통합으로 상태 공간의 데이터가 희박한 영역에서 정책 성능이 향상되었다.
  • 도메인 지식의 활용은 순수 강화학습 출력에 비해 더 강건하고 실용적인 제어 정책을 도출했다.
  • 이 방법은 동적 요금 신호에 강력하게 적응하여 건물 난방 시스템에서 효과적인 수요 반응을 가능하게 했다.
  • 결과는 실생활 건물 기후 제어에 배치 강화학습를 적용할 수 있으며, 실용적인 수렴 시간을 보장함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.