[论文解读] PowerGym: A Reinforcement Learning Environment for Volt-Var Control in Power Distribution Systems
PowerGym 是一个基于 IEEE 基准配电网(13Bus、34Bus、123Bus、8500Node)构建的开源、Gym 兼容的强化学习环境,用于辐射状配电网的 Volt-Var 控制,支持可配置的物理约束。它通过支持可扩展、安全且可扩展的训练,结合现实的电压和功率损耗目标,实现了 RL 算法的公平基准测试,经由 PPO 和 SAC 在多个系统变体上的系统性实验,量化了控制性能的权衡。
We introduce PowerGym, an open-source reinforcement learning environment for Volt-Var control in power distribution systems. Following OpenAI Gym APIs, PowerGym targets minimizing power loss and voltage violations under physical networked constraints. PowerGym provides four distribution systems (13Bus, 34Bus, 123Bus, and 8500Node) based on IEEE benchmark systems and design variants for various control difficulties. To foster generalization, PowerGym offers a detailed customization guide for users working with their distribution systems. As a demonstration, we examine state-of-the-art reinforcement learning algorithms in PowerGym and validate the environment by studying controller behaviors. The repository is available at \url{https://github.com/siemens/powergym}.
研究动机与目标
- 为解决在配电网 Volt-Var 控制中缺乏标准化、公开可用的强化学习基准环境的问题。
- 通过基于 IEEE 基准系统的统一、开放平台,实现电力系统研究人员之间对 RL 算法的公平比较。
- 通过提供详细的定制指南,支持将专有配电网模型集成到实际部署中。
- 通过可配置的环境变化,促进基于 RL 的控制策略的泛化与可扩展性。
- 通过在前沿算法(如 PPO 和 SAC)上进行系统性强化学习实验,验证环境的保真度与实用性。
提出的方法
- PowerGym 实现了类似 Gym 的 API,包含 reset、step 和 render 函数,支持与现有强化学习框架无缝集成。
- 它使用功率潮流方程(式 1)将配电网建模为辐射状网络,整合了有功/无功功率、电压幅值和电流幅值等物理约束。
- 该环境支持四个标准 IEEE 测试系统(13Bus、34Bus、123Bus、8500Node),并可配置负载比例、基准电压越限和电池荷电状态惩罚。
- 它引入了四个关键的环境超参数:负载比例、基准电压越限、时域长度和 SOC 惩罚,用于调节控制难度与现实性。
- 奖励函数结合了功率损耗最小化、电压越限惩罚和电池荷电状态误差,以指导策略学习。
- 它通过安全的文件约束执行机制支持并行训练,并提供可视化工具以监控控制器行为和系统状态。
实验结果
研究问题
- RQ1PowerGym 的设计如何实现配电网 Volt-Var 控制中 RL 算法的公平且可复现的基准测试?
- RQ2环境超参数(如负载比例、基准电压越限和 SOC 惩罚)对 RL 代理控制难度和性能的影响是什么?
- RQ3不同 RL 算法(如 PPO 和 SAC)在 PowerGym 中不同系统规模和环境配置下的表现如何?
- RQ4PowerGym 的结构在多大程度上可通过定制化支持向真实、专有的配电网系统进行泛化?
- RQ5在高负载环境下,电压越限减少与电池活动之间的权衡如何体现,其在学习结果中如何反映?
主要发现
- 在 PowerGym 中,RL 代理的累积奖励随时域长度线性增长,h96 在 20,000 步内获得的累积奖励约为 h24 的四倍。
- 在较长时域下,8500Node 系统的收敛速度慢于 123Bus,这是由于其更高的不稳定性及更强的电压越限倾向。
- 更高的负载比例会增加功率损耗和电压越限,使环境更难控制,尤其在 8500Node 等大型系统中更为显著。
- 电池放电活动与电压越限之间存在权衡:电池活动更高的环境(如 s2.5)表现出更低的电压越限,但更高的 SOC 误差。
- SOC 惩罚引入了非平稳的电池行为,增加了训练难度,这从 cbat_soc_s2.5 中更高的 SOC 误差方差中得到验证,相较于无惩罚变体。
- 该环境的设计成功支持了并行训练,并能够实现对控制器行为的有意义分析,PPO 和 SAC 在所有测试系统中均实现了稳定的训练曲线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。