Skip to main content
QUICK REVIEW

[논문 리뷰] Bi-level Off-policy Reinforcement Learning for Volt/VAR Control Involving Continuous and Discrete Devices

Haotian Liu, Wenchuan Wu|arXiv (Cornell University)|2021. 04. 13.
Optimal Power Flow Distribution참고 문헌 35인용 수 5
한 줄 요약

이 논문은 활성 배전망에서 전압/无공 전력 제어(Volt/VAR control)를 위한 양자수준의 비모델 기반 딥 강화학습 프레임워크를 제안한다. 이는 정확한 시스템 모델이 필요 없이 느린 시간스케일 이산 장치(예: OLTC)와 빠른 시간스케일 연속 장치(예: DG)를 조율한다. 방법은 이산 동작을 위해 다중 이산 소프트 액터-크리틱(MDSAC)을, 연속 동작을 위해 비모델 기반 소프트 액터-크리틱을 사용하며, 훈련을 안정화하기 위해 새로운 다중 시간스케일 비모델 보정(MTOPC)을 도입하여, 모델-프리 설정에서 기준 방법보다 30% 낮은 손실을 기록하며 거의 최적의 성능을 달성한다.

ABSTRACT

In Volt/Var control (VVC) of active distribution networks(ADNs), both slow timescale discrete devices (STDDs) and fast timescale continuous devices (FTCDs) are involved. The STDDs such as on-load tap changers (OLTC) and FTCDs such as distributed generators should be coordinated in time sequence. Such VCC is formulated as a two-timescale optimization problem to jointly optimize FTCDs and STDDs in ADNs. Traditional optimization methods are heavily based on accurate models of the system, but sometimes impractical because of their unaffordable effort on modelling. In this paper, a novel bi-level off-policy reinforcement learning (RL) algorithm is proposed to solve this problem in a model-free manner. A Bi-level Markov decision process (BMDP) is defined to describe the two-timescale VVC problem and separate agents are set up for the slow and fast timescale sub-problems. For the fast timescale sub-problem, we adopt an off-policy RL method soft actor-critic with high sample efficiency. For the slow one, we develop an off-policy multi-discrete soft actor-critic (MDSAC) algorithm to address the curse of dimensionality with various STDDs. To mitigate the non-stationary issue existing the two agents' learning processes, we propose a multi-timescale off-policy correction (MTOPC) method by adopting importance sampling technique. Comprehensive numerical studies not only demonstrate that the proposed method can achieve stable and satisfactory optimization of both STDDs and FTCDs without any model information, but also support that the proposed method outperforms existing two-timescale VVC methods.

연구 동기 및 목표

  • 정확한 시스템 모델에 의존하지 않고 느린 시간스케일 이산 장치(STDDs)와 빠른 시간스케일 연속 장치(FTCDs)를 전압/무공 전력 제어(VVC)에서 효과적으로 조율하는 도전 과제를 해결한다.
  • 빠르게 변화하는 활성 배전망(ADNs)에서 실용적이지 않은 광범위한 모델링 작업이 필요한传통적인 모델 기반 최적화 방법의 한계를 극복한다.
  • 두 개별 시간스케일에서 동시에 최적화하는 느린 시간스케일 이산 장치와 빠른 시간스케일 연속 장치를 공동으로 최적화하는 데이터 기반, 모델-프리 강화학습 프레임워크를 개발한다.
  • 서로 다른 시간스케일에서 동시에 학습하고 상호 간섭을 일으키는 경험 분포의 비정적 특성으로 인해 발생하는 훈련 과정의 불안정성을 해결한다.
  • 비모델 기반 알고리즘과 새로운 다중 시간스케일 보정 메커니즘을 활용하여 샘플 효율성을 높이고 거의 최적의 성능을 달성한다.

제안 방법

  • 두 시간스케일 VVC 문제를 양자수준 마르코프 결정 과정(BMDP)으로 공식화하여, 느린 제어 장치(STDDs)와 빠른 제어 장치(FTCDs)의 제어를 별개의 하위 문제로 분리한다.
  • DG 및 SVC와 같은 장치의 연속 제어를 위해 비모델 기반 소프트 액터-크리틱(SAC)을 사용하는 빠른 시간스케일 에이전트(FTA)를 구현하여 높은 샘플 효율성을 확보한다.
  • 이산 동작 공간의 차원의 악몽 문제를 완화하기 위해 가치 함수를 분해하는 새로운 다중 이산 소프트 액터-크리틱(MDSAC) 알고리즘을 사용하는 느린 시간스케일 에이전트(STA)를 설계한다.
  • FTA의 경험 분포와 STA의 경험 분포 간의 분포 이탈을 보정하기 위해 중요도 샘플링 기반의 다중 시간스케일 비모델 보정(MTOPC) 방법을 도입하여 공동 훈련 중 비정적 특성을 감소시킨다.
  • 24,000개의 FTA 스텝 크기의 리PLAY 버퍼를 사용하고, 배치 업데이트 및 무작위 가중치 초기화를 통해 파이토치 기반 프레임워크에서 종단 간(end-to-end)으로 에이전트를 훈련시킨다.
  • MTOPC를 적용하여 리PLAY 버퍼 내 전이를 재가중함으로써, FTA 정책이 오래되었더라도 STA의 정책 업데이트가 보정된 기대값에 기반하도록 보장한다.

실험 결과

연구 질문

  • RQ1모델-프리, 이중 수준의 비모델 기반 강화학습 프레임워크가 전압/무공 전력 제어에서 느린 시간스케일 이산 장치와 빠른 시간스케일 연속 장치를 효과적으로 조율할 수 있는가?
  • RQ2전압/무공 전력 제어를 위한 다중 에이전트 강화학습에서 이산 동작 공간(예: OLTC 탭 위치, 커패시터 스위칭)의 차원의 악몽 문제를 어떻게 완화할 수 있는가?
  • RQ3서로 다른 시간스케일에서 작동하는 두 에이전트의 정책이 비정적 경험 분포로 인해 상호 간섭할 경우, 훈련을 안정화시키는 데 어떤 메커니즘이 필요한가?
  • RQ4모델-프리 딥 강화학습 방법이 손실 감소 및 전압 프로파일 향상 측면에서 모델 기반 또는 단일 시간스케일 딥 강화학습 기준 방법보다 얼마나 뛰어나게 성능을 낼 수 있는가?
  • RQ5제안된 MTOPC 방법은 보정 없이 표준 비모델 기반 훈련과 비교해 훈련 안정성과 수렴 속도를 크게 향상시키는가?

주요 결과

  • 33버스 시험 피드어웨이에서 제안된 방법은 네트워크 주요 전력 손실이 8.30 × 10⁻² MW로 측정되었으며, S-DQN(6.05 × 10⁻² MW)과 A-OPT(1.08 × 10⁻¹ MW)를 능가했지만 오라클 OPT(4.59 × 10⁻² MW)에 비해 略로 높았다.
  • 전압 위반 비율(VVR)은 0 p.u.로 최적 해와 동일하게 유지되었고, 탭 조작 횟수는 2.4로 A-OPT(7.0)와 S-DQN(4.3)보다 크게 감소했다.
  • MTOPC를 적용한 경우, 2,000 FTA 스텝 내에 거의 최적의 성능에 도달했으며, 비-OPC 변형은 훨씬 더 많은 샘플이 필요하고 랜덤 시드 간에 높은 분산을 보였다.
  • MTOPC 보정 가중치 ω′의 평균은 훈련이 진행됨에 따라 약 1.0 근처로 안정화되었으며, 이는 오래된 FTA 정책에 대한 효과적인 보정이 이루어졌음을 시사하며, 후반기에는 낮은 표준편차를 보였다.
  • STA에 사용된 MDSAC 알고리즘은 안정성과 수렴 속도 측면에서 DQN보다 뛰어나 고차원 이산 동작 공간을 효과적으로 처리할 수 있음을 입증했다.
  • 모델-프리 방법은 네트워크 토폴로지나 파라미터에 접근할 수 없음에도 불구하고 경쟁 가능한 성능을 달성했으며, A-OPT와 S-DQN는 FTA 최적화를 위해 오라클 모델에 의존하는 반면, 본 방법은 이를 필요로 하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.