[论文解读] Scalable Voltage Control using Structure-Driven Hierarchical Deep Reinforcement Learning
本文提出了一种面向电力系统中可扩展紧急电压控制的结构驱动分层深度强化学习(DRL)框架。通过将电网划分为多个区域,并行训练去中心化的底层DRL智能体,同时由高层协调智能体使用改进的增强随机搜索算法协调动作,该方法相比集中式训练将训练时间减少了约60%,同时在多种故障场景下实现了相当或更优的电压恢复性能。
This paper presents a novel hierarchical deep reinforcement learning (DRL) based design for the voltage control of power grids. DRL agents are trained for fast, and adaptive selection of control actions such that the voltage recovery criterion can be met following disturbances. Existing voltage control techniques suffer from the issues of speed of operation, optimal coordination between different locations, and scalability. We exploit the area-wise division structure of the power system to propose a hierarchical DRL design that can be scaled to the larger grid models. We employ an enhanced augmented random search algorithm that is tailored for the voltage control problem in a two-level architecture. We train area-wise decentralized RL agents to compute lower-level policies for the individual areas, and concurrently train a higher-level DRL agent that uses the updates of the lower-level policies to efficiently coordinate the control actions taken by the lower-level agents. Numerical experiments on the IEEE benchmark 39-bus model with 3 areas demonstrate the advantages and various intricacies of the proposed hierarchical approach.
研究动机与目标
- 为解决集中式与去中心化强化学习在大规模电力系统电压控制中的局限性,包括训练缓慢、可扩展性差以及缺乏协调。
- 开发一种可扩展、模块化的DRL架构,利用电力系统固有的区域化结构,实现高效训练与部署。
- 显著减少训练时间,同时在多种故障条件下保持或提升电压恢复性能。
- 实现鲁棒、自适应的紧急切负荷,确保在多种预想故障下电压稳定,且不依赖精确的系统模型。
- 在IEEE 39节点系统上验证该方法,通过多种故障场景,证明其对未见故障的泛化能力。
提出的方法
- 该框架采用两级分层DRL架构:底层智能体在预定义的电网区域内部独立运行,学习本地电压恢复策略。
- 高层协调智能体利用底层智能体的策略更新,智能选择并协调各区域的控制动作。
- 采用改进的约束增强随机搜索(CARS)算法,以高效训练底层和高层DRL智能体。
- 底层智能体使用每个区域九种故障场景并行训练,策略更新在训练过程中实时传递给协调器。
- 协调器与底层智能体同步训练,仅使用部分故障轨迹(三种故障持续时间:0、0.05和0.08秒)以减少仿真时间。
- 通过解耦底层训练并利用结构聚类(区域划分)来强制实现层级结构,避免多智能体强化学习中的非平稳性问题。
实验结果
研究问题
- RQ1分层DRL框架是否能在减少训练时间的同时,实现与集中式DRL相当或更优的电压恢复性能?
- RQ2去中心化的底层智能体与高层协调器之间的协调,在多种故障条件下如何提升电压稳定性?
- RQ3与全规模集中式训练相比,基于结构的分层设计在提升可扩展性与减少训练时间方面有多大优势?
- RQ4所提出的方法是否能泛化到训练集中未包含的故障位置?
- RQ5在训练过程中实时共享底层策略更新,如何影响高层协调器的收敛性与性能?
主要发现
- 分层DRL方法将总训练时间减少至2.29小时,相比集中式方法的5.705小时减少了60%。
- 高层协调智能体在所有故障场景下的平均奖励与集中式DRL策略相当或更优,包括集中式方法未能恢复电压的案例。
- 对于关键故障母线(如母线15),分层设计成功将电压恢复至安全范围,而集中式方法未能实现。
- 该方法表现出鲁棒的泛化能力:在训练中未使用的故障母线上也实现了稳定性能,证实了策略的泛化能力。
- 使用实时底层策略更新训练协调器,相比仅使用已收敛的底层策略,实现了更快的收敛速度和更高的奖励。
- 底层智能体按区域去中心化训练耗时分别为35.87、44.04和53.06分钟(区域1、2、3),协调器训练在2.26小时内完成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。