Skip to main content
QUICK REVIEW

[논문 리뷰] Batch-Constrained Reinforcement Learning for Dynamic Distribution Network Reconfiguration

Yuanqi Gao, Wang Wei|arXiv (Cornell University)|2020. 06. 23.
Optimal Power Flow Distribution참고 문헌 37인용 수 9
한 줄 요약

이 논문은 환경 상호작용 없이 역사적 운영 데이터로부터 학습하는 데이터 기반 강화학습 알고리즘인 배치 제약 소프트 액터-크리틱(Batch-Constrained Soft Actor-Critic, BCSAC)을 제안한다. 이 방법은 KL 정규화와 배치 제약을 통해 외삽 오차를 감소시켜, 세 가지 테스트 시스템에서 최신의 RL 및 모델 기반 방법보다 뛰어난 성능과 실시간 확장성을 달성한다.

ABSTRACT

Dynamic distribution network reconfiguration (DNR) algorithms perform hourly status changes of remotely controllable switches to improve distribution system performance. The problem is typically solved by physical model-based control algorithms, which not only rely on accurate network parameters but also lack scalability. To address these limitations, this paper develops a data-driven batch-constrained reinforcement learning (RL) algorithm for the dynamic DNR problem. The proposed RL algorithm learns the network reconfiguration control policy from a finite historical operational dataset without interacting with the distribution network. The numerical study results on three distribution networks show that the proposed algorithm not only outperforms state-of-the-art RL algorithms but also improves the behavior control policy, which generated the historical operational data. The proposed algorithm is also very scalable and can find a desirable network reconfiguration solution in real-time.

연구 동기 및 목표

  • 정확한 네트워크 파라미터가 필요로 하고 확장성에 떨어지는 모델 기반 동적 배전망 재구성(DNR) 방법의 한계를 해결한다.
  • 유한한 역사적 데이터셋에서 효과적인 제어 정책을 학습하는 데 도전하며, 표준 RL 방법이 높은 외삽 오차를 겪는 문제를 해결한다.
  • 기존의 역사적 데이터 생성 정책보다 나은 성능을 보이는 데이터 기반, 확장성 있고 실시간 동작이 가능한 DNR 솔루션을 개발한다.
  • KL 발산 정규화와 배치 제약을 통합하여 배치 RL에서 제약 조건 이행과 정책 안정성을 확보한다.
  • 다양한 복잡도를 지닌 실제 배전망 테스트 케이스에서 제안된 방법의 실현 가능성과 우수성을 입증한다.

제안 방법

  • 네트워크 상태와 행동의 유한한 역사적 데이터셋을 사용하여 동적 DNR을 배치 강화학습 문제로 공식화한다.
  • 행동 정책에 대한 KL 발산을 통해 정책 업데이트를 제약하는 새로운 배치 제약 소프트 액터-크리틱(BCSAC) 알고리즘을 제안한다. 이 알고리즘은 누적 할인 수익의 최대화를 목표로 한다.
  • 학습 안정성 향상과 외삽 오차 감소를 위해 보정된 보상 함수를 도입한다: $ r^{ au}(s,a) = r(s,a) - au \text{KL}[ ilde{\rho}(\theta)(a|s) || \rho^b(a|s)] $.
  • 기대 수익 최대화와 행동 정책에서의 발산 최소화라는 이중 최적화 목표를 가진 소프트 액터-크리틱 프레임워크를 사용한다.
  • 제안된 연산자 $ \tilde{\tau}^{\tau} $ 하에서 가치 함수 업데이트의 수렴성을 보장하기 위해 수축 사상 원리를 적용한다. 이는 안정적인 학습 동역학을 보장한다.
  • 각 정책 업데이트가 행동 정책에 가까이 유지되도록 배치 제약을 적용한 정책 반복 기법을 사용한다. 이는 일반화 성능과 샘플 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1실제 시스템과 상호작용 없이도 데이터 기반 배치 RL 접근법이 최신의 RL 및 모델 기반 방법보다 동적 배전망 재구성에서 승리할 수 있는가?
  • RQ2배치 RL 알고리즘이 역사적 데이터를 생성한 행동 정책을 얼마나 뛰어나게 개선할 수 있는가?
  • RQ3제한된 역사적 네트워크 재구성 데이터로부터 학습할 때 KL 정규화가 외삽 오차를 얼마나 효과적으로 완화하는가?
  • RQ4제안된 방법이 다양한 크기와 복잡도를 지닌 배전망에서 실시간 성능과 확장성을 달성할 수 있는가?
  • RQ5배치 제약 형식이 불완전한 데이터와 불확실성 하에서 안정적이고 타당한 정책 학습을 보장하는가?

주요 결과

  • 제안된 BCSAC 알고리즘은 세 가지 테스트 배전망 전역에서 총 비용 절감 측면에서 최신의 RL 알고리즘을 모두 능가한다.
  • BCSAC는 역사적 데이터를 생성한 행동 정책보다도 성능을 향상시켜, 학습된 정책이 원래 운영 전략보다 더 잘 일반화됨을 보여준다.
  • 전통적인 모델 기반 제어기보다 훨씬 낮은 계산 시간을 기록하여 실시간 성능를 달성한다. 이는 실질적 구현 가능성을 보장한다.
  • KL 정규화와 배치 제약 메커니즘 덕분에 제약 조건 이행률(예: 루프 제거 및 전압 한계)이 높게 유지된다.
  • 수치적 결과는 BCSAC가 기준선 방법보다 네트워크 손실과 DG 제어를 더 효과적으로 줄임을 보여주며, 특히 높은 불확실성 하에서도 유사한 성능을 발휘한다.
  • 이론적 분석을 통해 제안된 배치 제약 프레임워크 하에서 가치 함수의 수렴성과 학습된 정책의 최적성은 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.