Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stage Deep Reinforcement Learning for Inverter-based Volt-VAR Control in Active Distribution Networks

Haotian Liu, Wenchuan Wu|arXiv (Cornell University)|2020. 05. 20.
Optimal Power Flow Distribution참고 문헌 33인용 수 6
한 줄 요약

이 논문은 모델 파rameter의 정확도가 떨어지는 활성 배전망(ADNs)에서 인버터 기반의 버스- VAR 제어를 위한 이중 단계 딥 강화학습(DRL) 프레임워크를 제안한다. 모델 불일치에 대비한 강건한 에이전트를 훈련하기 위해 오프라인 단계에서 새로운 공동 적대형 소프트 액터-크리틱(JASAC) 알고리즘을 사용하며, 이후 이 에이전트는 온라인 단계에서 SAC를 사용하여 안전하고 효율적인 실시간 제어로 이관된다. 이는 IEEE 33-버스 및 69-버스 시스템에서 기준 DRL 방법들보다 안전성과 성능 면에서 뚜렷이 뛰어나다.

ABSTRACT

Model-based Vol/VAR optimization method is widely used to eliminate voltage violations and reduce network losses. However, the parameters of active distribution networks(ADNs) are not onsite identified, so significant errors may be involved in the model and make the model-based method infeasible. To cope with this critical issue, we propose a novel two-stage deep reinforcement learning (DRL) method to improve the voltage profile by regulating inverter-based energy resources, which consists of offline stage and online stage. In the offline stage, a highly efficient adversarial reinforcement learning algorithm is developed to train an offline agent robust to the model mismatch. In the sequential online stage, we transfer the offline agent safely as the online agent to perform continuous learning and controlling online with significantly improved safety and efficiency. Numerical simulations on IEEE test cases not only demonstrate that the proposed adversarial reinforcement learning algorithm outperforms the state-of-art algorithm, but also show that our proposed two-stage method achieves much better performance than the existing DRL based methods in the online application.

연구 동기 및 목표

  • 이론적 네트워크 파라미터가 모델 기반 Volt-VAR 제어에서 심각한 오차를 유발하는 활성 배전망(ADNs)에서의 모델 불일치 문제를 해결하는 데 초점을 맞춘다.
  • 온라인 학습 전용 DRL 훈련의 높은 위험도와 비효율성을 해결하기 위해 오프라인 강건 훈련과 온라인 배포를 분리하는 이중 단계 학습 프레임워크를 도입한다.
  • 오프라인 환경으로부터 지식이 풍부하고 적대적으로 훈련된 에이전트를 이관함으로써 온라인 Volt-VAR 제어의 안전성과 효율성을 향상시킨다.
  • 오프라인 훈련 동안 모델링 오차의 영향을 명시적으로 모델링하고 이를 완화하는 공동 적대형 소프트 액터-크리틱(JASAC) 알고리즘을 개발한다. 이는 전이 갭을 줄이기 위함이다.
  • 실제 적용 가능한 시나리오에서 현실적인 ADN 모델을 사용하여 최신 DRL 및 최적화 기반 방법들과 비교했을 때 뛰어난 온라인 성능을 입증한다.

제안 방법

  • 온라인 단계에서 Volt-VAR 제어 문제를 마르코프 결정 과정(MDP)으로 공식화하여 반응 전력 조절을 위한 순차적 의사결정을 가능하게 한다.
  • 오프라인 훈련을 위해 이론적(식별되지 않은) 네트워크 파라미터를 사용하여 근사적 ADN 모델을 구축하여 실제 세계의 불확실성을 시뮬레이션한다.
  • 모델 불일치를 적대적 방해 요소로 간주하는 공동 적대형 소프트 액터-크리틱(JASAC) 알고리즘을 제안하며, 이는 적대적 MDP(AMDP) 프레임워크에 기반한다.
  • 오프라인 단계에서 주인공 에이전트(OFF-A)와 적대자 에이전트를 동시에 훈련하며, 적대자 에이전트가 최악의 모델링 오차를 시뮬레이션하여 주인공의 강건성을 향상시킨다.
  • 주인공과 적대자 에이전트 간의 공유 정보를 활용하여 적대적 환경에서의 수렴 속도를 가속화하고 훈련 효율성을 향상시킨다.
  • 사전 훈련된 오프라인 에이전트(OFF-A)를 온라인 단계로 이관하여 온라인 에이전트(ON-A)의 초기 정책으로 사용하며, 이후 소프트 액터-크리틱(SAC) 알고리즘을 사용해 연속적인 온라인 학습을 수행한다.

실험 결과

연구 질문

  • RQ1모델 불일치 상황에서 ADN Volt-VAR 제어의 오프라인 훈련과 온라인 배포 간 성능 격차를 효과적으로 줄일 수 있는 이중 단계 DRL 프레임워크가 가능한가?
  • RQ2제안된 공동 적대형 소프트 액터-크리틱(JASAC) 알고리즘이 표준 DRL 기준선 대비 모델링 오차에 대한 오프라인 에이전트의 강건성을 뚜렷이 향상시키는가?
  • RQ3사전 훈련된 적대적으로 강건한 오프라인 에이전트를 이관함으로써 온라인 Volt-VAR 제어의 안전성과 수렴 속도는 어느 정도 향상되는가?
  • RQ4최신 DRL 및 최적화 기반 방법들과 비교했을 때, 제안된 이중 단계 방법은 유동 전력 손실과 전압 조절(VR) 성능 측면에서 어떻게 성과를 내는가?
  • RQ5기존의 적대형 DRL 방법들과 비교했을 때, JASAC 알고리즘이 오프라인 단계에서 더 나은 수렴성과 훈련 안정성을 달성하는가?

주요 결과

  • 제안된 이중 단계 DRL 방법은 온라인 제어 성능을 크게 향상시켰다: IEEE 33-버스 시스템에서 JASAC는 초기 시점의 유동 전력 손실 증가량을 SAC 기준선의 1.74 MW에서 0.437 MW로 감소시켰으며, 최대 시점에서는 1.76 MW에서 0.502 MW로 감소시켰다.
  • 33-버스 시스템에서 JASAC는 VR 오차를 SAC 대비 약 40% 감소시켜 초기 평균 VR을 1.10×10⁻³로, 최대 시점에서는 1.39×10⁻³로 달성했다.
  • 69-버스 시스템에서 JASAC는 초기 평균 유동 전력 손실 증가량을 단지 0.0675 MW로 유지하여 SAC(0.137 MW)와 preSAC(0.036 MW)를 모두 초월했으며, VR은 7.16×10⁻⁵로 감소시켰다.
  • 오프라인 JASAC 알고리즘은 벤치마크 적대형 DRL 알고리즘 대비 더 뛰어난 수렴성과 훈련 효율성을 보였으며, 더 빠르고 안정적인 오프라인 훈련을 가능케 했다.
  • 오프라인 에이전트(OFF-A)의 온라인 단계로의 이관은 온라인 학습을 크게 가속화했으며, 온라인 에이전트(ON-A)가 초기 단계부터 고성능 행동을 취할 수 있도록 해 위험도와 비용을 줄였다.
  • 제안된 방법은 다른 테스트된 방법들보다 이상적인 최적 해(완벽한 모델을 사용한 경우)에 더 가까운 성능을 달성했으며, 33-버스 시스템에서 JASAC의 초기 성능은 최적 손실 증가량의 4.37% 이내였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.