Skip to main content
QUICK REVIEW

[논문 리뷰] Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks

Yuanqi Gao, Wang Wei|arXiv (Cornell University)|2020. 07. 06.
Optimal Power Flow Distribution참고 문헌 30인용 수 5
한 줄 요약

이 논문은 활성 분포망에서의 버스전압-无공전력 제어를 위한 공감 다중에이전트 강화학습(C-MARL) 알고리즘을 제안한다. 이는 네트워크 구조나 파라미터 지식에 의존하지 않고 탈중앙화된 모델 프리 제어를 가능하게 하며, 최대 엔트로피 강화학습 프레임워크 내에서 통신 효율적인 공감 전략을 사용하여 중심집중식 강화학습과 유사한 성능을 달성하면서도 에이전트나 통신 장애에 강건함을 입증한다.

ABSTRACT

Volt-VAR control (VVC) is a critical application in active distribution network management system to reduce network losses and improve voltage profile. To remove dependency on inaccurate and incomplete network models and enhance resiliency against communication or controller failure, we propose consensus multi-agent deep reinforcement learning algorithm to solve the VVC problem. The VVC problem is formulated as a networked multi-agent Markov decision process, which is solved using the maximum entropy reinforcement learning framework and a novel communication-efficient consensus strategy. The proposed algorithm allows individual agents to learn a group control policy using local rewards. Numerical studies on IEEE distribution test feeders show that our proposed algorithm matches the performance of single-agent reinforcement learning benchmark. In addition, the proposed algorithm is shown to be communication efficient and resilient.

연구 동기 및 목표

  • 정확한 네트워크 모델이나 중심집중식 조율가 필요 없는 탈중앙화된, 데이터 기반의 버스전압-무공전력 제어 방법을 개발하기 위해.
  • 중심집중식 제어 아키텍처에서 흔히 발생하는 개별 에이전트나 통신 링크 장애에 대한 시스템의 내성을 향상시키기 위해.
  • 기존의 공감 기반 방법(예: ADMM)과 비교해 통신 오버헤드를 줄이면서도 높은 제어 성능을 유지하기 위해.
  • 전역 상태 정보에 의존하지 않고 국소 보상과 가치 함수 정렬을 통해 다중에이전트 간 협업을 가능하게 하기 위해.
  • 실제 장애 상황을 고려한 표준 IEEE 분포계통 시험 피더에서 방법을 검증하고 중심집중식 강화학습 기준과 비교하기 위해.

제안 방법

  • 각 에이전트의 국소 보상이 있는 네트워크 기반 다중에이전트 마르코프 결정 과정(MMDP)으로 버스전압-무공전력 제어 문제를 수식화한다.
  • 탐색을 장려하고 샘플 효율성을 향상시키기 위해 최대 엔트로피 강화학습 프레임워크를 적용한다.
  • 무작위화 기반 프로토콜을 사용해 에이전트의 가치 함수를 정렬하는 새로운 통신 효율적인 공감 전략을 도입한다.
  • 각 에이전트는 전역 상태 가치 함수를 근사하는 데 사용되는 딥 신경망과 국소 정책을 학습하는 데 사용되는 또 다른 딥 신경망을 학습한다.
  • 이웃 에이전트의 가치 함수 간 이질성을 최소화하는 공감 목표를 통해 협동 학습을 가능하게 한다.
  • 에이전트가 국소 관측과 이웃 에이전트와의 제한된 통신에 기반해 정책을 업데이트하는 탈중앙화된 학습 기반을 적용한다.

실험 결과

연구 질문

  • RQ1다중에이전트 딥 강화학습 접근법이 완전한 네트워크 모델이 없이도 중심집중식 강화학습과 유사한 버스전압-무공전력 제어 성능을 달성할 수 있는가?
  • RQ2제안된 공감 전략은 ADMM와 같은 통신 집약적인 기존 방법과 비교해 통신 효율성 측면에서 어떻게 비교되는가?
  • RQ3실시간 운영 환경에서 개별 에이전트나 통신 링크 장애에 대해 제안된 C-MARL 알고리즘이 어느 정도 내성적인가?
  • RQ4국소 보상 최적화와 가치 함수 공감을 조합하면 탈중앙화된 버스전압-무공전력 제어에서 효과적인 전역 협업을 이끌 수 있는가?
  • RQ5분포형 에너지 자원이 포함된 활성 분포망에서 흔한 고차원 상태 공간에서도 이 방법이 성능을 유지하는가?

주요 결과

  • 제안된 C-MARL 알고리즘은 IEEE 분포계통 시험 피더에서 단일에이전트 딥 강화학습 기준과 유사한 버스전압-무공전력 제어 성능을 달성한다.
  • 알고리즘이 에이전트 장애와 통신 링크 장애 모두에 대해 매우 높은 내성을 보이며, 장기 성능 저하가 최소한이다.
  • ADMM 기반의 공감 기반 시스템과 비교해 통신 오버헤드가 크게 감소하여 대규모 실시간 구현에 적합하다.
  • 네트워크 구조나 파라미터 지식 없이도 운영 데이터와 국소 상호작용에만 의존해 작동한다.
  • 공감 메커니즘이 효과적으로 에이전트의 가치 함수를 정렬하여 제한된 통신으로도 협동 제어를 가능하게 한다.
  • 수치적 연구 결과, 구성 요소 정리 시간이 지나치게 길지 않은 한 장애 조건에서도 성능 손실가 거의 없음을 확인하여 동적 환경에서의 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.