Skip to main content
QUICK REVIEW

[论文解读] Learning to run a power network challenge for training topology controllers

Antoine Marot, Benjamin Donnot|arXiv (Cornell University)|Dec 5, 2019
Optimal Power Flow Distribution参考文献 15被引用 60
一句话总结

论文通过模仿学习与强化学习的框架来学习电网的拓扑控制智能体,并报告了首届 Learning to Run a Power Network (L2RPN) 竞赛,使用基于 IEEE14 的环境,以及一个 oracle 上限分析揭示优化差距。

ABSTRACT

For power grid operations, a large body of research focuses on using generation redispatching, load shedding or demand side management flexibilities. However, a less costly and potentially more flexible option would be grid topology reconfiguration, as already partially exploited by Coreso (European RSC) and RTE (French TSO) operations. Beyond previous work on branch switching, bus reconfigurations are a broader class of action and could provide some substantial benefits to route electricity and optimize the grid capacity to keep it within safety margins. Because of its non-linear and combinatorial nature, no existing optimal power flow solver can yet tackle this problem. We here propose a new framework to learn topology controllers through imitation and reinforcement learning. We present the design and the results of the first "Learning to Run a Power Network" challenge released with this framework. We finally develop a method providing performance upper-bounds (oracle), which highlights remaining unsolved challenges and suggests future directions of improvement.

研究动机与目标

  • 将拓扑重新配置作为一种灵活、成本有效的手段,激励在可再生能源接入和需求波动下使电网保持在安全裕度内。
  • 提供一个平台,用于学习和基准测试在实时电力系统环境中运行的拓扑控制智能体。
  • 探索强化学习及相关 AI 方法在连续、近实时电网优化中的可行性与鲁棒性。
  • 提供基于 oracle 的上界,以量化提交的智能体在拓扑控制性能上与最优解的接近程度。

提出的方法

  • 基于 IEEE14 的开源合成电力网络环境,具有拓扑动作(线路开关与母线切换)和实时注入。
  • 将问题表述为双因素马尔可夫决策过程,以捕捉未观测输入、观测注入、拓扑以及输出(潮流和超载)。
  • 定义一个实时奖励/分数函数,旨在最大化剩余网容量,同时对非法行动和级联故障进行惩罚。
  • 在为期6周的 Codalab 竞赛中实现并评估多样化智能体(强化学习、专家系统和树搜索)。
  • 对智能体行为、动作空间降维策略和鲁棒性进行分析;与基于路径的 oracle 上界进行性能边界对比。
  • 在前几名中使用 A3C(actor-critic)和 dueling DQN 架构,结合课程学习和专家规则引导,以提高稳定性和性能。

实验结果

研究问题

  • RQ1在安全与运营约束下,RL 及相关 AI 方法是否能够学习到适用于实时电网运行的有效拓扑控制策略?
  • RQ2行动空间设计与专家先验对学习效率和策略鲁棒性在拓扑重新配置任务中的影响如何?
  • RQ3学习到的智能体在最优拓扑轨迹上的接近程度有多大,以及与 oracle 上界之间的差距?
  • RQ4场景的哪些特征(难度、持续时间、超载时机)最考验当前方法?
  • RQ5基于挑战的基准是否为推进电力系统拓扑控制研究提供了一个富有成效的平台?

主要发现

  • 基于 RL 的方法在竞赛中取得了最佳成绩。
  • 领先队伍包括 LB(dueling DQN + prior analysis)和 LR(基于 A3C 的 actor-critic),并且具备开源代码;LR 在测试阶段不对仿真进行查询而进行学习。
  • 一个基于轨迹的 oracle 上界揭示了最佳智能体与最优解之间仍存在的优化差距。
  • 大多数参赛者限制了探索,一些智能体将注意力集中在少量变电站上,凸显了探索与利用之间的权衡。
  • 研究表明通过 AI 实现拓扑控制的可行性,并指出未来基准在鲁棒性与可扩展性方面的差距。
  • 分析显示尽管顶尖智能体可以完成测试情景,但仍存在若干具挑战性的情景无人成功,促使开展更大规模的基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。