Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Energy Dispatch Based on Deep Reinforcement Learning in IoT-Driven Smart Isolated Microgrids

Lei Lei, Yue Tan|arXiv (Cornell University)|2020. 02. 07.
Smart Grid Energy Management참고 문헌 45인용 수 8
한 줄 요약

이 논문은 디젤 발전기, 태양광 패널, 배터리가 포함된 IoT 기반 고립형 마이크로그리드에서 동적 에너지 배분을 위한 유한시간 영역 딥 강화학습 알고리즘인 FH-DDPG와 FH-RDPG를 제안한다. 문제를 유한시간 영역 부분 관측 가능 마르코프 결정 과정(POMDP)으로 모델링함으로써, 기준선 DRL 및 MPC 방법에 비해 안정성과 성능을 향상시키며, 이전 데이터를 활용하여 하중 및 태양광 발전의 불확실성을 더 잘 다루고 운영 비용을 낮춘다.

ABSTRACT

Microgrids (MGs) are small, local power grids that can operate independently from the larger utility grid. Combined with the Internet of Things (IoT), a smart MG can leverage the sensory data and machine learning techniques for intelligent energy management. This paper focuses on deep reinforcement learning (DRL)-based energy dispatch for IoT-driven smart isolated MGs with diesel generators (DGs), photovoltaic (PV) panels, and a battery. A finite-horizon Partial Observable Markov Decision Process (POMDP) model is formulated and solved by learning from historical data to capture the uncertainty in future electricity consumption and renewable power generation. In order to deal with the instability problem of DRL algorithms and unique characteristics of finite-horizon models, two novel DRL algorithms, namely, finite-horizon deep deterministic policy gradient (FH-DDPG) and finite-horizon recurrent deterministic policy gradient (FH-RDPG), are proposed to derive energy dispatch policies with and without fully observable state information. A case study using real isolated MG data is performed, where the performance of the proposed algorithms are compared with the other baseline DRL and non-DRL algorithms. Moreover, the impact of uncertainties on MG performance is decoupled into two levels and evaluated respectively.

연구 동기 및 목표

  • 고도로 재생 가능 에너지가 통합된 마이크로그리드에서 하중 및 발전의 불확실성이 존재하는 동적 에너지 배분 문제를 해결하기 위해.
  • 실제 마이크로그리드 운영에서 흔한 유한시간 영역, 부분 관측 가능 환경에 특화된 안정적인 딥 강화학습 알고리즘을 개발하기 위해.
  • 태양광 발전 및 배터리 저장을 최적화하여 디젤 발전기 운영 비용을 최소화하기 위해.
  • 하중 및 태양광 발전의 불확실성이 마이크로그리드 성능에 미치는 영향을 분리 분석을 통해 평가하기 위해.
  • 실제 데이터를 사용하여 기준선 DRL 및 모델 기반 MPC 방법과의 비교를 통해 제안된 알고리즘의 성능을 평가하기 위해.

제안 방법

  • 하중 및 태양광 발전의 불확실성을 고려한 에너지 배분을 유한시간 영역 부분 관측 가능 마르코프 결정 과정(POMDP) 모델로 수립한다.
  • 완전 관측 가능한 상태를 위한 유한시간 영역 딥 디터미니스틱 정책 기울기(FH-DDPG)와 부분 관측 가능한 상태를 위한 유한시간 영역 순환 DDPG(FH-RDPG)라는 두 가지 새로운 DRL 알고리즘을 제안한다.
  • 이전 하중 및 PV 데이터를 사용하여 정책을 학습하고, 확률적 시스템 동역학을 시뮬레이션하여 일반화 및 안정성 향상을 도모한다.
  • FH-RDPG에서 장기 기억 임계값(LSTM) 네트워크를 활용하여 시간적 의존성을 모델링하고 부분 관측 가능성을 처리한다.
  • 비교를 위한 기준으로 반복 선형 정규화 최적화(iLQG)를 적용한 모델 예측 제어(MPC)를 적용한다.
  • 2017년 7월의 실제 고립형 마이크로그리드 데이터를 사용하여 성능 평가를 수행하였으며, 7일, 14일, 21일의 이전 데이터 윈도우로 학습하고 같은 날의 데이터로 테스트한다.

실험 결과

연구 질문

  • RQ1유한시간 영역 DRL 알고리즘이 고립형 마이크로그리드의 동적 에너지 배분에서 안정성과 성능을 어떻게 향상시키는가?
  • RQ2불확실성 하에서 FH-DDPG 및 FH-RDPG가 기준선 DDPG 및 RDPG에 비해 운영 비용과 내구성 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ3DRL 기반 배분에서 이전 데이터 학습과 같은 날의 데이터 학습이 정책의 일반화 및 성능에 어떤 영향을 미치는가?
  • RQ4하중 및 태양광 발전의 불확실성이 마이크로그리드 성능에 미치는 영향은 무엇이며, 이를 정량적으로 분리 분석할 수 있는가?
  • RQ5배터리의 충전 상태(SoC) 등 일부 상태 정보만 제공되는 경우에도 제안된 알고리즘이 에너지 배분을 효과적으로 관리할 수 있는가?

주요 결과

  • 제안된 FH-DDPG 및 FH-RDPG 알고리즘은 완전 관측 및 부분 관측 조건 모두에서 기준선 DDPG 및 RDPG에 비해 디젤 발전기 운영 비용을 크게 낮춘다.
  • FH-RDPG는 POMDP 환경에서 뛰어난 성능을 보이며, 실제 구현에서 흔한 제한된 상태 정보 하에서도 효과적인 의사결정을 수행함을 입증한다.
  • FH-DDPG 및 FH-RDPG는 같은 날의 데이터 또는 7일에서 21일까지의 이전 데이터로 학습하든 간에 성능이 안정적이고 일관되게 유지되며, 뛀난 일반화 능력을 보인다.
  • MPC-iLQG 및 MPC-iLQG-POMDP 기준보다 성능이 뛰어나며, 특히 불확실성 하에서 DRL 기반 접근이 모델 기반 예측 제어보다 유리함을 입증한다.
  • RNN를 사용한 PV 및 하중 예측 오차는 각각 2.27×10⁻³ 및 1.39×10⁻³(정규화된 MSE 기준)였으며, 이러한 오차를 줄이면 MPC 기반 방법의 성능 향상이 가능하다.
  • 연구는 불확실성을 두 수준으로 분리 분석함으로써 시스템 성능에 미치는 영향을 정량화하였으며, DRL 기반 방법이 일일 예측 오차에 대해 내구성이 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.