Skip to main content
QUICK REVIEW

[论文解读] PowerGridworld: A Framework for Multi-Agent Reinforcement Learning in Power Systems

David Biagioni, Xiangyu Zhang|arXiv (Cornell University)|Nov 10, 2021
Smart Grid Energy Management被引用 7
一句话总结

PowerGridworld 是一个开源、轻量级的框架,通过集成电网感知组件和潮流计算解决方案,支持在复杂、真实世界的电力系统场景中快速原型化多智能体强化学习(MARL)环境。它支持可定制的异构智能体,并能与 RLLib 和 OpenAI Gym 无缝集成,成功实现了在 PPO 和 MADDPG 算法下对 MARL 策略的训练。

ABSTRACT

We present the PowerGridworld software package to provide users with a lightweight, modular, and customizable framework for creating power-systems-focused, multi-agent Gym environments that readily integrate with existing training frameworks for reinforcement learning (RL). Although many frameworks exist for training multi-agent RL (MARL) policies, none can rapidly prototype and develop the environments themselves, especially in the context of heterogeneous (composite, multi-device) power systems where power flow solutions are required to define grid-level variables and costs. PowerGridworld is an open-source software package that helps to fill this gap. To highlight PowerGridworld's key features, we present two case studies and demonstrate learning MARL policies using both OpenAI's multi-agent deep deterministic policy gradient (MADDPG) and RLLib's proximal policy optimization (PPO) algorithms. In both cases, at least some subset of agents incorporates elements of the power flow solution at each time step as part of their reward (negative cost) structures.

研究动机与目标

  • 解决在异构电力系统中训练多智能体强化学习(MARL)策略时缺乏标准化、灵活环境的问题。
  • 支持在组件级控制与系统级约束下,快速构建定制化、电网交互的 MARL 仿真环境。
  • 支持与现有 MARL 训练框架(如 RLLib 和 OpenAI Gym)集成,以加速研究与部署。
  • 促进未来更具韧性与能效的能源系统中去中心化、数据驱动控制策略的开发。
  • 提供“自带模型”(bring-your-own-model)方法,使研究人员可在保持电网物理保真度的前提下,灵活插入自定义设备模型与奖励结构。

提出的方法

  • 设计基于 Gym 的模块化、可扩展 API,支持单体与多组件智能体的多智能体环境。
  • 在每个控制步长集成潮流计算解决方案(通过 OpenDSS),以计算母线电压、功率流等电网级变量。
  • 定义基于潮流计算结果的智能体特定观测空间与奖励函数,包含对电压和功率限值的软约束。
  • 使用用户自定义的控制步长间隔,模拟实时或亚小时级电网动态,实现配电网的高保真度仿真。
  • 实现智能体奖励函数,平衡本地目标(如热舒适度、负荷转移)与电网支持目标(如电压调节、峰值负荷降低)。
  • 利用 RLLib 和 OpenAI 的 MADDPG 训练独立的 MARL 策略,损失函数基于近端策略优化(PPO)与优势裁剪。

实验结果

研究问题

  • RQ1模块化、开源的框架是否能加速复杂、异构电力系统中多智能体强化学习策略的开发?
  • RQ2当智能体奖励依赖于实时潮流计算结果与电网约束时,MARL 策略的训练效率如何?
  • RQ3通过共享电网变量(如最小母线电压)实现的松散耦合,对 MARL 训练的稳定性与收敛性影响有多大?
  • RQ4PowerGridworld 是否能够在单一统一的仿真环境中支持多种智能体类型(如建筑、光伏阵列、电动汽车充电站)?
  • RQ5该框架与高性能计算及现有 MARL 训练流水线(如 RLLib 和 OpenAI Gym)的集成效果如何?

主要发现

  • PowerGridworld 通过集成 OpenDSS,成功实现了包含潮流计算解决方案的异构、电网交互式 MARL 环境构建。
  • 针对依赖电网奖励的智能体(如电压约束)训练独立的 PPO 策略时,收敛稳定,未出现显著非平稳性问题。
  • 该框架支持多种智能体类型,包括具备热控制功能的智能建筑、可调控的光伏阵列,以及具备动态负荷特性的电动汽车充电站。
  • 奖励函数有效平衡了本地目标(如热舒适度、充电需求)与电网支持目标(如峰值负荷降低、电压调节)。
  • 与 RLLib 的集成支持利用高性能计算资源进行可扩展训练,证明了其与生产级 MARL 流水线的兼容性。
  • 该框架的模块化设计与 Gym API 使得在电力系统背景下,能够快速实验新型组件模型与 MARL 算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。