Skip to main content
QUICK REVIEW

[논문 리뷰] PowerGym: A Reinforcement Learning Environment for Volt-Var Control in Power Distribution Systems

Ting-Han Fan, Xian Yeow Lee|arXiv (Cornell University)|2021. 09. 08.
Optimal Power Flow Distribution참고 문헌 27인용 수 11
한 줄 요약

PowerGym은 물리적 제약 조건을 사용자 정의할 수 있는 반경형 배전시스템에서의 전압-无공 제어를 위한 오픈소스, Gym 호환 강화학습 환경이다. IEEE 기준 네트워크(13Bus, 34Bus, 123Bus, 8500Node)를 기반으로 하며, 실질적인 전압 및 손실 최소화 목표를 통해 보다 스케일링 가능하고 안전하며 확장 가능한 훈련을 가능하게 하며, PPO와 SAC를 활용한 다수의 시스템 변형에서 정량화된 제어 성능의 상충 관계를 검증함으로써 RL 알고리즘의 공정한 벤치마킹을 가능하게 한다.

ABSTRACT

We introduce PowerGym, an open-source reinforcement learning environment for Volt-Var control in power distribution systems. Following OpenAI Gym APIs, PowerGym targets minimizing power loss and voltage violations under physical networked constraints. PowerGym provides four distribution systems (13Bus, 34Bus, 123Bus, and 8500Node) based on IEEE benchmark systems and design variants for various control difficulties. To foster generalization, PowerGym offers a detailed customization guide for users working with their distribution systems. As a demonstration, we examine state-of-the-art reinforcement learning algorithms in PowerGym and validate the environment by studying controller behaviors. The repository is available at \url{https://github.com/siemens/powergym}.

연구 동기 및 목표

  • 분포션 시스템의 전압-무공 제어에서 강화학습을 벤치마킹하기 위한 표준화되고 공개된 환경의 부족을 해결하기 위해.
  • IEEE 기준 시스템을 기반으로 한 공통의 오픈 플랫폼을 제공함으로써 전력 시스템 연구자들 간의 RL 알고리즘 간 공정한 비교를 가능하게 하기 위해.
  • 기존의 전력 시스템 모델을 통합하기 위한 세부 맞춤 설정 가이드를 제공함으로써 실세계 적용을 지원하기 위해.
  • 환경의 구성 가능한 변형을 통해 RL 기반 제어 전략의 일반화 및 확장성을 촉진하기 위해.
  • 최신 알고리즘인 PPO와 SAC를 활용한 체계적인 RL 실험을 통해 환경의 정밀도와 유용성을 검증하기 위해.

제안 방법

  • PowerGym은 기존 RL 프레임워크와의 원활한 통합을 위해 Gym 유사 API를 구현하며, reset, step, render 기능을 제공한다.
  • 전력 흐름 방정식(Eq. 1)을 사용하여 반경형 네트워크로 분포 시스템을 모델링하며, 유동/무공 전력, 전압 크기, 전류 크기 등의 물리적 제약 조건을 통합한다.
  • 4개의 표준 IEEE 테스트 시스템(13Bus, 34Bus, 123Bus, 8500Node)을 지원하며, 하중 스케일링, 기준 전압 위반, 배터리 상태-충전율 페널티 등의 구성 가능한 변형을 제공한다.
  • 환경의 어려움과 현실성에 영향을 주는 4개의 핵심 환경 하이퍼파라미터를 도입: 하중 스케일, 기준 전압 위반, 환경 기간 길이, SOC 페널티.
  • 보상 함수는 전력 손실 최소화, 전압 위반 페널티, 배터리 상태-충전율 오차를 통합하여 정책 학습을 이끌도록 설계된다.
  • 안전하고 파일 기반 제약 조건이 적용된 실행 방식을 통해 병렬 훈련을 지원하며, 제어기 행동과 시스템 상태를 모니터링하기 위한 시각화 도구를 제공한다.

실험 결과

연구 질문

  • RQ1PowerGym의 설계는 분포 시스템의 전압-무공 제어를 위한 RL 알고리즘에 대한 공정하고 재현 가능한 벤치마킹을 어떻게 가능하게 하는가?
  • RQ2하중 스케일, 기준 전압 위반, SOC 페널티와 같은 환경 하이퍼파라미터가 RL 에이전트의 어려움과 성능에 미치는 영향은 무엇인가?
  • RQ3PPO와 SAC와 같은 다양한 RL 알고리즘이 PowerGym에서 시스템 크기와 환경 구성에 따라 어떻게 성능을 발휘하는가?
  • RQ4사용자 정의 가능한 설정을 통해 PowerGym의 아키텍처는 실세계의 전용 분포 시스템에 얼마나 잘 일반화되는가?
  • RQ5고하중 환경에서 전압 위반 감소와 배터리 활동 간의 상충 관계는 무엇이며, 이는 학습 결과에 어떻게 반영되는가?

주요 결과

  • PowerGym에서 RL 에이전트의 누적 보상은 환경 기간 길이에 비례하여 선형적으로 증가하며, h96는 20,000단계 동안 h24에 비해 약 4배의 누적 보상을 기록한다.
  • 긴 기간 환경에서 8500Node 시스템은 123Bus에 비해 수렴 속도가 떨어지며, 더 높은 불안정성과 전압 위반 경향을 보인다.
  • 높은 하중 스케일은 전력 손실과 전압 위반을 증가시켜 특히 8500Node와 같은 큰 시스템에서는 제어가 훨씬 어려워진다.
  • 배터리 방전 활동과 전압 위반 사이에 상충 관계가 존재한다: 더 높은 배터리 활동(예: s2.5)을 가진 환경은 낮은 전압 위반을 보이지만 더 높은 SOC 오차를 보인다.
  • SOC 페널티는 비정상적인 배터리 행동을 유도하여 학습 난이도를 증가시키며, 이는 cbat_soc_s2.5에서 비페널티 버전 대비 더 높은 SOC 오차 분산을 통해 뚜렷하게 드러난다.
  • 환경 설계는 병렬 훈련을 성공적으로 지원하며, 제어기 행동 분석에 의미 있는 통찰을 제공한다. PPO와 SAC는 모든 테스트 시스템에서 안정적인 학습 곡선을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.