Skip to main content
QUICK REVIEW

[论文解读] Rethink AI-based Power Grid Control: Diving Into Algorithm Design

Xiren Zhou, Siqi Wang|arXiv (Cornell University)|Dec 23, 2020
Reinforcement Learning in Robotics参考文献 10被引用 5
一句话总结

本文提出了一种基于模仿学习的AI驱动电力系统电压控制方法,通过直接映射电网运行状态到最优控制动作,绕过了复杂的深度强化学习(DRL)训练过程。该方法在可解情况下实现一步求解,具备出色的泛化能力,并且相较于DRL智能体显著减少了训练时间,在样本效率和鲁棒性方面优于SAC和基于DQN的模型。

ABSTRACT

Recently, deep reinforcement learning (DRL)-based approach has shown promisein solving complex decision and control problems in power engineering domain.In this paper, we present an in-depth analysis of DRL-based voltage control fromaspects of algorithm selection, state space representation, and reward engineering.To resolve observed issues, we propose a novel imitation learning-based approachto directly map power grid operating points to effective actions without any interimreinforcement learning process. The performance results demonstrate that theproposed approach has strong generalization ability with much less training time.The agent trained by imitation learning is effective and robust to solve voltagecontrol problem and outperforms the former RL agents.

研究动机与目标

  • 为解决深度强化学习(DRL)在电力系统电压控制中样本效率低和奖励函数设计困难的局限性。
  • 研究电压控制中马尔可夫决策过程(MDP)的内在结构,重点关注状态表示、算法选择和奖励工程。
  • 通过利用模仿学习直接将电网状态映射到控制动作,开发一种比DRL更高效、更鲁棒的替代方法。
  • 基于国家电网江苏公司的真实电网数据验证所提方法,展示其出色的泛化能力和快速收敛性。

提出的方法

  • 作者将电压控制建模为连续状态、连续动作的MDP,其状态空间由母线电压、相角、线路潮流以及发电机有功/无功功率构成。
  • 提出一种奖励函数,强调最终成功,鼓励智能体从每个回合中最终成功的动作中学习。
  • 在从随机策略收集的专家示范数据上训练模仿学习智能体,每个示范包含一次成功回合中的状态-动作对。
  • 从9,433个训练案例中构建专家示范数据集D,捕捉1,000步回合中成功转移的状态-动作对。
  • 模仿学习智能体学习一个策略π,可将任意状态s映射到一个动作a,使电压越限问题在一步内解决,无需奖励塑形或超参数调优。
  • 使用主成分分析(PCA)分析状态空间中可解与不可解案例的分布,揭示了两者之间存在清晰的边界。

实验结果

研究问题

  • RQ1状态空间和奖励函数的设计如何影响DRL智能体在电压控制中的样本效率和收敛性?
  • RQ2模仿学习方法是否能在训练速度、泛化能力和鲁棒性方面优于DRL智能体用于电力系统电压控制?
  • RQ3通过仅调节发电机电压整定值,现实中多少比例的电压越限案例本质上是不可解的?
  • RQ4在状态空间中,可解与不可解电压控制案例之间是否存在清晰的结构性差异?

主要发现

  • 模仿学习智能体在训练集和测试集上均实现了100%的一次性求解率,所有可解案例均在一步内解决。
  • 模仿学习智能体的训练时间显著短于DRL智能体,且无需复杂的奖励函数工程或超参数调优。
  • 该方法展现出强大的泛化能力:即使示范数据来自与测试案例不同的初始状态,仍有97.9%的测试案例在一步内被解决。
  • PCA分析揭示了状态空间中可解与不可解案例之间存在清晰边界,其中2.1%的测试案例本质上无法通过电压整定控制解决。
  • 采用贪婪动作选择的SAC智能体在训练集上实现100%的一次性求解率,但在测试集上仅为97.8%,而模仿学习智能体在测试集上保持了97.9%的求解率。
  • 随机策略在1,000步内仅解决了98.7%的训练案例和98.7%的测试案例,表明约1.3%的案例存在困难或本质上不可解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。