[论文解读] Multi-Agent Reinforcement Learning for Power Grid Topology Optimization
本文提出了一种分层多智能体强化学习(MARL)框架,通过母线切换动作实现电网拓扑优化,以提升电网的可靠性与可扩展性。通过在每个变电站分解控制并利用SACD与PPO算法,该方法在性能上可与单智能体方法相媲美,同时提升了训练稳定性并增强了对网络变化的适应能力。
Recent challenges in operating power networks arise from increasing energy demands and unpredictable renewable sources like wind and solar. While reinforcement learning (RL) shows promise in managing these networks, through topological actions like bus and line switching, efficiently handling large action spaces as networks grow is crucial. This paper presents a hierarchical multi-agent reinforcement learning (MARL) framework tailored for these expansive action spaces, leveraging the power grid's inherent hierarchical nature. Experimental results indicate the MARL framework's competitive performance with single-agent RL methods. We also compare different RL algorithms for lower-level agents alongside different policies for higher-order agents.
研究动机与目标
- 解决因母线与线路切换导致的大规模电力网络中组合动作空间庞大所带来的强化学习(RL)可扩展性挑战。
- 克服单智能体RL以及基于规则或后状态RL方法在动态电网条件下适应能力不足的局限性。
- 开发一种合作式多智能体框架,利用输电网固有的分层结构,以提升控制效率与可扩展性。
- 对比不同MARL架构与低层级智能体所采用的RL算法(SACD、PPO),并评估中层级策略(CAPA、固定策略、随机策略)在协调方面的表现。
- 证明多智能体RL可在保持更优稳定性与适应性的同时,实现与单智能体基线相当的电网最优性能。
提出的方法
- 实施三级分层MARL架构:高层基于规则的智能体负责全局协调,中层智能体选择作用的变电站,低层智能体执行母线切换动作。
- 使用图神经网络(GNNs)编码变电站拓扑与潮流状态,使智能体能够对图结构化的电网数据进行推理。
- 在低层级采用SACD(Soft Actor-Critic Discrete)与PPO(Proximal Policy Optimization)作为强化学习算法,采用集中式训练、分布式执行(CTDE)策略以提升样本效率。
- 引入两种多智能体变体:独立PPO(IPPO)与去中心化PPO(DPPO),以及两种SACD变体:独立SACD(ISACD)与去中心化SACD(DSACD),以评估协调策略。
- 通过Optuna进行超参数优化,以调优多智能体智能体的参数,从而在性能上超越直接从单智能体配置迁移的方案。
- 使用Grid2Op环境模拟真实电网运行,包括拓扑变化与故障处理,奖励基于电网安全性与潮流稳定性设定。
实验结果
研究问题
- RQ1分层多智能体RL框架是否能在电网拓扑优化中实现与单智能体RL相当的性能,同时提升可扩展性?
- RQ2在多智能体设置下,不同低层级RL算法(SACD与PPO)在电网拓扑控制中的表现如何?
- RQ3不同中层级协调策略(CAPA、固定策略、随机策略)对MARL系统学习稳定性与最终性能有何影响?
- RQ4与直接从单智能体设置迁移参数相比,超参数调优在多智能体RL智能体性能提升方面有多大程度的改善?
- RQ5与单智能体或后状态RL方法相比,去中心化多智能体方法是否显著提升了对网络变化的适应能力?
主要发现
- 经超参数调优的去中心化SACD(DSACD)智能体在与单智能体SACD相当的环境交互次数后达到最优得分,同时保持了显著更高的训练稳定性。
- 经调优超参数的ISACD智能体虽达到峰值性能,但表现出不稳定性,凸显SACD在多智能体设置下对超参数选择的高度敏感性。
- 基于PPO的多智能体智能体(IPPO与DPPO)对超参数差异的敏感性低于SACD,二者在与单智能体PPO相似的交互次数后均达到最优性能。
- 中层级CAPA策略在学习稳定性与最终性能方面均优于固定策略与随机策略,而随机策略导致最不稳定的训练动态。
- 多智能体框架成功减小了每个智能体的有效动作空间,提升了可扩展性,并使复杂动作(如发电机再调度)的集成更加容易。
- 分层MARL框架在性能上与单智能体RL相当,同时展现出更强的鲁棒性与适应性,尤其在动态电网条件下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。