Skip to main content
QUICK REVIEW

[论文解读] Power Grid Congestion Management via Topology Optimization with AlphaZero

Matthias Dorfer, Anton R. Fuxjäger|arXiv (Cornell University)|Nov 10, 2022
Complex Network Analysis Techniques被引用 9
一句话总结

本文提出了一种基于AlphaZero的强化学习智能体,用于电力系统网络拓扑优化,以在不依赖昂贵再调度的情况下减少阻塞。通过动态重新配置电网开关,该智能体将平均再调度需求降低了60%,并将成本降至基线水平的40%,在优于传统方法的同时,实现了可再生能源接入电网中的零碳阻塞管理。

ABSTRACT

The energy sector is facing rapid changes in the transition towards clean renewable sources. However, the growing share of volatile, fluctuating renewable generation such as wind or solar energy has already led to an increase in power grid congestion and network security concerns. Grid operators mitigate these by modifying either generation or demand (redispatching, curtailment, flexible loads). Unfortunately, redispatching of fossil generators leads to excessive grid operation costs and higher emissions, which is in direct opposition to the decarbonization of the energy sector. In this paper, we propose an AlphaZero-based grid topology optimization agent as a non-costly, carbon-free congestion management alternative. Our experimental evaluation confirms the potential of topology optimization for power grid operation, achieves a reduction of the average amount of required redispatching by 60%, and shows the interoperability with traditional congestion management methods. Our approach also ranked 1st in the WCCI 2022 Learning to Run a Power Network (L2RPN) competition. Based on our findings, we identify and discuss open research problems as well as technical challenges for a productive system on a real power grid.

研究动机与目标

  • 为应对风能和太阳能等波动性可再生能源带来的日益严重的电网阻塞问题。
  • 减少对昂贵且产生碳排放的化石燃料发电机组再调度的依赖。
  • 通过强化学习实现的网络拓扑优化,开发一种低成本、零碳的阻塞管理解决方案。
  • 将拓扑优化与传统阻塞管理方法相结合,以提升电网的韧性与成本效率。
  • 通过基准测试和真实场景用例,证明该方法的实际可行性。

提出的方法

  • 该智能体采用AlphaZero的蒙特卡洛树搜索(MCTS)结合深度强化学习,以探索最优的电网拓扑变更。
  • 该方法在Grid2Op环境生成的模拟电网状态上,通过自对弈和自监督学习训练策略网络与价值网络。
  • 拓扑动作以输电线路开关操作的形式表示,动作空间被缩减为可处理的子集,以实现高效探索。
  • 智能体被训练以在模拟电网运行中最大化生存步数,同时最小化再调度需求。
  • 该方法在竞争性场景(WCCI 2022 L2RPN)中进行评估,并与基线智能体及混合智能体进行比较。
  • 开发了一个基于网络的AI辅助控制演示系统,用于可视化多步、多候选的故障恢复策略。

实验结果

研究问题

  • RQ1基于AlphaZero的智能体能否有效优化电力系统网络拓扑,在不依赖昂贵再调度的情况下减少阻塞?
  • RQ2与传统阻塞管理方法相比,拓扑优化在成本、韧性及再调度减少方面表现如何?
  • RQ3拓扑优化在多大程度上可以与现有再调度策略有效结合?
  • RQ4在实际电力系统中部署此类智能体时,面临的关键技术挑战是什么?
  • RQ5如何改进动作空间表示以增强探索能力与电网范围内的优化潜力?

主要发现

  • 与基线方法相比,基于AlphaZero的拓扑智能体将平均所需再调度功率降低了60%。
  • 结合拓扑优化与传统措施的混合智能体在WCCI 2022 L2RPN竞赛中实现了82%的总生存步数,表现优于所有其他参赛者。
  • 该智能体仅需原基线成本的40%即可完成阻塞管理,显著降低了运营成本。
  • 最优拓扑动作仅与后续再调度兼容65%,表明需要对拓扑与再调度策略进行联合训练。
  • 该智能体在WCCI 2022 L2RPN竞赛中排名第一,证明了其强大性能与实际应用潜力。
  • 该方法可与现有阻塞管理系统互操作,并支持具有多步、可解释性建议的AI辅助控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。