Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning Based Volt-VAR Optimization in Smart Distribution Systems

Ying Zhang, Xinan Wang|arXiv (Cornell University)|2020. 03. 07.
Optimal Power Flow Distribution참고 문헌 25인용 수 9
한 줄 요약

이 논문은 비균형 스마트 배전계통에서의 버스- VAR 최적화(VVO)를 위한 다중 에이전트 딥 강화학습(MADRL) 프레임워크를 제안한다. 딥 Q네트워크(DQNs)를 사용하여 커패시터, 전압 조절기, 인버터 설정을 동적으로 제어하며, 동시에 전압 조절과 손실 감소를 달성한다. 시뮬레이션을 통해 IEEE 13-bus 및 123-bus 시스템에서 시간에 따라 변하는 조건에서도 뛰어난 성능을 입증하였다.

ABSTRACT

This paper develops a model-free volt-VAR optimization (VVO) algorithm via multi-agent deep reinforcement learning (MADRL) in unbalanced distribution systems. This method is novel since we cast the VVO problem in unbalanced distribution networks to an intelligent deep Q-network (DQN) framework, which avoids solving a specific optimization model directly when facing time-varying operating conditions of the systems. We consider statuses/ratios of switchable capacitors, voltage regulators, and smart inverters installed at distributed generators as the action variables of the DQN agents. A delicately designed reward function guides these agents to interact with the distribution system, in the direction of reinforcing voltage regulation and power loss reduction simultaneously. The forward-backward sweep method for radial three-phase distribution systems provides accurate power flow results within a few iterations to the DQN environment. Finally, the proposed multi-objective MADRL method realizes the dual goals for VVO. We test this algorithm on the unbalanced IEEE 13-bus and 123-bus systems. Numerical simulations validate the excellent performance of this method in voltage regulation and power loss reduction.

연구 동기 및 목표

  • 명시적인 최적화 모델에 의존하지 않고 시간에 따라 변하는 시스템 조건에 적응할 수 있는 모델 기반 VVO 알고리즘을 개발하는 것.
  • 스위치 가능한 커패시터, 전압 조절기, 스마트 인버터의 지능적인 제어를 통해 비균형 3상 배전망에서 전압 위반과 전력 손실을 해결하는 것.
  • DQN 프레임워크 내에서 전압 조절과 전력 손실 감소를 동시에 촉진하는 보상 함수를 설계하는 것.
  • 강화학습 환경 내에서 시스템 상태 평가를 정확하고 빠르게 수행하기 위해 정방향-역방향 스weep 전력 흐름 방법을 통합하는 것.
  • 실제 분포계통 테스트 케이스에서 MADRL 기반 VVO 접근법의 유효성을 검증하는 것.

제안 방법

  • VVO 문제는 DQN 에이전트가 제어 변수인 커패시터 상태, 전압 조절기 탭 위치, 인버터 VAR 출력을 제어하는 마르코프 결정 과정(MDP)으로 공식화된다.
  • 각 에이전트가 분포계통 내 일부 제어 가능한 장치를 제어하는 다중 에이전트 딥 강화학습(MADRL) 프레임워크가 사용된다.
  • 전압 위반과 전력 손실을 징벌하는 보상 함수를 설계하여 에이전트가 최적의 제어 정책을 향해 유도된다.
  • 정방향-역방향 스weep 방법은 몇 번의 반복 내에 정확하고 효율적인 3상 전력 흐름을 계산하여 DQN 환경 내 실시간 시뮬레이션을 가능하게 한다.
  • DQN 에이전트는 시스템과의 상호작용을 통해 엔드 투 엔드 정책을 학습하며, 경험 재생과 타겟 네트워크를 통해 Q값을 업데이트한다.
  • 알고리즘은 역사적 부하 및 재생 에너지 발전 데이터를 사용하여 동적인 운영 조건을 시뮬레이션하도록 훈련된다.

실험 결과

연구 질문

  • RQ1모델 기반이 아닌 딥 강화학습 접근법이 비균형 배전계통에서 버스- VAR 제어 최적화에 효과적으로 작용할 수 있는가?
  • RQ2시간에 따라 변하는 부하 및 발전 조건 하에서 MADRL 기반 VVO 방법이 전압 조절과 전력 손실 감소에 얼마나 잘 기여하는가?
  • RQ3철저히 설계된 보상 함수가 DQN 에이전트의 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ4정방향-역방향 스weep 방법의 통합이 강화학습 환경 내 전력 흐름 계산의 정확성과 속도를 어떻게 향상시키는가?
  • RQ5제안된 방법이 동적 배전망에서 전통적인 최적화 기반 VVO 접근법을 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • 제안된 MADRL 기반 VVO 방법은 모든 테스트 케이스에서 모든 버스 전압을 표준 규제 한계(0.95–1.05 p.u.) 내에 유지하였다.
  • 기본 사례(제어 없음)와 비교해 IEEE 123-bus 시스템에서 활동 전력 손실을 최대 18.7% 감소시켰다.
  • 전압 조절이 크게 향상되어, 제어되지 않은 경우 대비 최대 전압 편차가 60% 이상 감소하였다.
  • 다양한 부하 및 재생 에너지 발전 시나리오에서 뛰어난 성능을 보이며, 동적 조건에 대한 강력한 적응성을 입증하였다.
  • 정방향-역방향 스weep 방법은 빠르고 정확한 전력 흐름 계산을 가능하게 하여 강화학습 환경 내 실시간 의사결정을 지원하였다.
  • 보상 함수 설계가 전압 조절과 손실 감소 간의 트레이드오���을 효과적으로 균형 잡아 안정적이고 수렴성 있는 훈련을 이끌었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.