Skip to main content
QUICK REVIEW

[논문 리뷰] Real-world challenges for multi-agent reinforcement learning in grid-interactive buildings

Kingsley Nweye, Bo Liu|arXiv (Cornell University)|2021. 11. 25.
Smart Parking Systems Research인용 수 4
한 줄 요약

이 논문은 그리드 인터랙티브 빌딩에서 다중 에이전트 강화학습(MARL)의 9가지 실제 도전 과제를 규명하고, 벤치마킹과 재현 가능성을 향상시키기 위해 표준화된 프레임워크를 제안한다. 실험을 통해 최적화된 규칙 기반 컨트롤러(RBC)에서 더 오래된 오프라인 훈련이 장기적인 에너지 유연성 성능을 크게 향상시키는 것으로 나타났으며, 에이전트 간 정보 공유는 테스트된 설정에서 유의미한 이점이 없음을 입증하였다.

ABSTRACT

Building upon prior research that highlighted the need for standardizing environments for building control research, and inspired by recently introduced challenges for real life reinforcement learning control, here we propose a non-exhaustive set of nine real world challenges for reinforcement learning control in grid-interactive buildings. We argue that research in this area should be expressed in this framework in addition to providing a standardized environment for repeatability. Advanced controllers such as model predictive control and reinforcement learning (RL) control have both advantages and disadvantages that prevent them from being implemented in real world problems. Comparisons between the two are rare, and often biased. By focusing on the challenges, we can investigate the performance of the controllers under a variety of situations and generate a fair comparison. As a demonstration, we implement the offline learning challenge in CityLearn and study the impact of different levels of domain knowledge and complexity of RL algorithms. We show that the sequence of operations utilized in a rule based controller (RBC) used for offline training affects the performance of the RL agents when evaluated on a set of four energy flexibility metrics. Longer offline learning from an optimized RBC leads to improved performance in the long run. RL agents that learn from a simplified RBC risk poorer performance as the offline learning period increases. We also observe no impact on performance from information sharing amongst agents. We call for a more interdisciplinary effort of the research community to address the real world challenges, and unlock the potential of grid-interactive building

연구 동기 및 목표

  • 그리드 인터랙티브 빌딩에서 강화학습(RL) 평가를 위한 표준화된 벤치마크 부족 문제를 해결하기 위해.
  • 빌딩 제어에 대한 MARL의 실질적 구현을 저해하는 실제 도전 과제를 규명하고 체계화하기 위해.
  • 모델 예측 제어(MPC) 및 규칙 기반 컨트롤러(RBC)와 같은 전통적 제어 방법과의 공정하고 체계적인 비교를 가능하게 하기 위해.
  • 오프라인 훈련 품질과 RBC 설계가 후속 RL 에이전트 성능에 미치는 영향을 입증하기 위해.
  • 실제 현장 적용을 가속화하기 위해 건물 과학과 기계 학습 분야 간의 융합적 협력을 촉진하기 위해.

제안 방법

  • 그리드 인터랙티브 빌딩에서 MARL의 실질적 구현 장벽에 초점을 맞춘 9가지 도전 과제(C1–C9)의 비완전한 프레임워크를 제안한다.
  • 실제 훈련 시나리오를 시뮬레이션하기 위해 CityLearn 환경을 사용하여 오프라인 학습 도전 과제(C8)를 구현하고 평가한다.
  • 기본 버전과 개선된 운영 로직을 가진 최적화된 버전의 두 가지 RBC에서 생성된 데이터를 사용해 RL 에이전트(SAC 및 MARLISA)를 훈련시킨다.
  • 도시 평균 일일 피크, 로드 팩터, 램프링, 순 전기 소비량의 네 가지 에너지 유연성 지표를 기반으로 에이전트 성능을 평가한다.
  • 재현 가능성을 보장하고 공동 벤치마킹을 가능하게 하기 위해 공통 인터페이스(OpenAI Gym)와 오픈소스 구현을 활용한다.
  • 오프라인 훈련 기간, RBC의 운영 순서, 에이전트 간 정보 공유가 최종 성능에 미치는 영향을 분석한다.

실험 결과

연구 질문

  • RQ1규칙 기반 컨트롤러(RBC)의 운영 순서에 따라 오프라인 사전 훈련 데이터의 품질이 후속으로 훈련된 RL 에이전트의 성능에 어떤 영향을 미치는가?
  • RQ2고품질 RBC에서 더 오래된 오프라인 훈련이 그리드 인터랙티브 빌딩의 장기적인 에너지 유연성 성능 향상에 기여하는가?
  • RQ3다중 에이전트 RL 알고리즘 간의 정보 공유가 핵심 에너지 유연성 지표에 성능에 어떤 영향을 미치는가?
  • RQ4보다 단순한 RL 알고리즘(예: SAC)이 실제 빌딩 제어 시나리오에서 더 복잡한 MARL 아키텍처를 능가할 수 있는가?
  • RQ5기존 RBC가 이미 상당한 에너지 유연성을 제공하는 정도는 어느 정도이며, 이로 인해 고도화된 RL 컨트롤러 도입의 한계적 이점이 줄어드는가?

주요 결과

  • 최적화된 RBC에서 더 오래된 오프라인 훈련은 초기 수렴 속도가 느리더라도 도시 평균 일일 피크, 로드 팩터, 램프링 감소 측면에서 뛰어난 장기 성능을 보였다.
  • 단순화된 RBC에서 훈련된 RL 에이전트의 성능은 오프라인 훈련 기간이 길어질수록 점점 악화되었으며, 이는 열악한 품질의 사전 훈련 데이터가 최종 성과를 떨어뜨린다는 것을 시사한다.
  • 네 가지 에너지 유연성 지표 전반에서 SAC와 MARLISA RL 알고리즘이 유의미한 성능 차이를 보이지 않아, 이 설정에서는 정보 공유의 추가 복잡성이 이점이 없음을 의미한다.
  • 모든 구성에서 순 전기 소비량은 거의 변화가 없었으며, 이는 RBC 설계—특히 고COP 열펌프를 활용한 야간 충전에 중점을 둔 것—이 이미 가용된 모든 에너지 유연성의 대부분을 포괄하고 있음을 시사한다.
  • 최적화된 RBC는 피크 수요 감소 및 로드 팩터 향상 측면에서 모든 RL 컨트롤러를 뛰어넘었으며, 이는 복잡한 RL 시스템을 도입하기보다는 기존 제어 논리를 개선하는 것이 더 효과적일 수 있음을 보여준다.
  • 결과적으로, 사전 훈련 데이터의 품질이 알고리즘 복잡성보다 더 중요하며, 고정밀도 RBC는 실제 현장 적용을 위한 강력한 베이스라인 역할을 할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.