Skip to main content
QUICK REVIEW

[논문 리뷰] PowerGridworld: A Framework for Multi-Agent Reinforcement Learning in Power Systems

David Biagioni, Xiangyu Zhang|arXiv (Cornell University)|2021. 11. 10.
Smart Grid Energy Management인용 수 7
한 줄 요약

PowerGridworld는 전력 시스템을 위한 다중 에이전트 강화학습(MARL) 환경의 빠른 프로토타이핑을 가능하게 하는 오픈소스이자 경량 프레임워크입니다. 그리드 인식 컴포넌트와 전력 흐름 솔루션을 통합하여, 사용자 정의가 가능한 이질적 에이전트와 RLLib 및 OpenAI Gym의 원활한 통합을 지원합니다. 복잡한 실제 전력 시스템 시나리오에서 PPO와 MADDPG를 사용하여 MARL 정책을 성공적으로 훈련시켰습니다.

ABSTRACT

We present the PowerGridworld software package to provide users with a lightweight, modular, and customizable framework for creating power-systems-focused, multi-agent Gym environments that readily integrate with existing training frameworks for reinforcement learning (RL). Although many frameworks exist for training multi-agent RL (MARL) policies, none can rapidly prototype and develop the environments themselves, especially in the context of heterogeneous (composite, multi-device) power systems where power flow solutions are required to define grid-level variables and costs. PowerGridworld is an open-source software package that helps to fill this gap. To highlight PowerGridworld's key features, we present two case studies and demonstrate learning MARL policies using both OpenAI's multi-agent deep deterministic policy gradient (MADDPG) and RLLib's proximal policy optimization (PPO) algorithms. In both cases, at least some subset of agents incorporates elements of the power flow solution at each time step as part of their reward (negative cost) structures.

연구 동기 및 목표

  • 이질적인 전력 시스템에서 다중 에이전트 강화학습(MARL) 정책을 훈련하기 위한 표준화되고 유연한 환경의 부족을 해결합니다.
  • 컴ponent 수준의 제어와 시스템 수준의 제약 조건을 갖춘 사용자 정의가 가능한 그리드 상호작용 MARL 시뮬레이션의 빠른 프로토타이핑을 가능하게 합니다.
  • RLLib 및 OpenAI Gym과 같은 기존 MARL 훈련 프레임워크와의 통합을 지원하여 연구 및 구현을 가속화합니다.
  • 미래의 내구성 있고 효율적인 에너지 시스템을 위한 탈중앙화된, 데이터 기반의 제어 정책 개발을 촉진합니다.
  • 연구자가 자체 기기 모델과 보상 구조를 통합할 수 있는 '자신의 모델을 가져오세요' 방식을 제공하면서도 그리드 물리 법칙의 정확성을 유지합니다.

제안 방법

  • 단일 및 다중 컴포넌트 에이전트를 모두 지원하는 모듈식이고 확장 가능한 Gym 기반 API를 설계하여 다중 에이전트 환경을 구현합니다.
  • 각 제어 단계에서 OpenDSS를 통해 전력 흐름 솔루션을 통합하여 버스 전압 및 전력 흐름과 같은 그리드 수준 변수를 계산합니다.
  • 전력 흐름 결과를 포함한 에이전트별 관측 공간과 보상 함수를 정의하며, 전압 및 전력 제한에 대한 소프트 제약 조건을 포함합니다.
  • 사용자가 정의한 제어 단계 간격을 사용하여 실시간 또는 시간 단위 이하의 그리드 동역학을 시뮬레이션함으로써 분포 피더의 현실적인 시뮬레이션을 가능하게 합니다.
  • 지역 목표(예: 열적 편안함, 부하 이동)와 그리드 지원 목표(예: 전압 조절, 피크 부하 감소)를 균형 잡는 에이전트 보상 함수를 구현합니다.
  • RLLib과 OpenAI의 MADDPG를 사용하여 독립적인 MARL 정책을 훈련시키며, 근접 정책 최적화(PPO) 및 이점 클리핑 기반의 손실 함수를 적용합니다.

실험 결과

연구 질문

  • RQ1모듈식이고 오픈소스인 프레임워크가 복잡하고 이질적인 전력 시스템에서 다중 에이전트 RL 정책의 개발을 얼마나 빠르게 가속화할 수 있을까요?
  • RQ2에이전트 보상이 실시간 전력 흐름 솔루션과 그리드 제약 조건에 의존할 경우, MARL 정책은 얼마나 효과적으로 훈련될 수 있을까요?
  • RQ3공유된 그리드 변수(예: 최소 버스 전압)를 통한 느슨한 결합이 MARL에서 훈련의 안정성과 수렴에 얼마나 영향을 미칠까요?
  • RQ4PowerGridworld는 한 개의 통합 시뮬레이션 환경 내에서 빌딩, 태양광 패널, 전기차 충전소와 같은 다양한 에이전트 유형을 지원할 수 있을까요?
  • RQ5이 프레임워크는 고성능 컴퓨팅 및 기존의 MARL 훈련 파이프라인인 RLLib 및 OpenAI Gym과 얼마나 잘 통합될 수 있을까요?

주요 결과

  • PowerGridworld는 OpenDSS를 통한 통합 전력 흐름 솔루션을 통해 이질적이고 그리드 상호작용이 가능한 MARL 환경을 성공적으로 구현했습니다.
  • 전압 제약 조건과 같은 그리드 의존적 보상이 있는 에이전트를 위한 독립적인 PPO 정책 훈련이 비정상성 문제 없이 안정적으로 수렴했습니다.
  • 프레임워크는 열 제어가 가능한 스마트 빌딩, 제어 가능한 태양광 패널, 동적 부하 프로파일을 갖춘 전기차 충전소를 포함한 다양한 에이전트 유형을 지원합니다.
  • 보상 함수는 지역 목표(예: 열적 편안함, 충전 수요)와 그리드 지원 목표(예: 피크 부하 감소, 전압 조절)를 효과적으로 균형 잡는 데 성공했습니다.
  • RLLib 통합을 통해 고성능 컴퓨팅 자원을 활용한 확장 가능한 훈련이 가능했으며, 생산 수준의 MARL 파이프라인과의 호환성을 입증했습니다.
  • 모듈식 설계와 Gym API 덕분에 프레임워크는 전력 시스템 환경에서 새로운 컴포넌트 모델과 MARL 알고리즘에 대한 빠른 실험을 가능하게 했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.