Skip to main content
QUICK REVIEW

[论文解读] Bi-level Off-policy Reinforcement Learning for Volt/VAR Control Involving Continuous and Discrete Devices

Haotian Liu, Wenchuan Wu|arXiv (Cornell University)|Apr 13, 2021
Optimal Power Flow Distribution参考文献 35被引用 5
一句话总结

本文提出了一种双层离策略深度强化学习框架,用于主动配电网中的电压/无功控制(Volt/VAR Control, VVC),在无需系统模型的情况下协调慢时变离散设备(如OLTC)与快时变连续设备(如DG)。该方法采用多离散软演员-critic(MDSAC)处理离散动作,离策略软演员-critic处理连续动作,并引入一种新颖的多时变离策略校正(MTOPC)机制以稳定训练,在无模型设置下实现接近最优的性能,相比基线方法损失降低30%。

ABSTRACT

In Volt/Var control (VVC) of active distribution networks(ADNs), both slow timescale discrete devices (STDDs) and fast timescale continuous devices (FTCDs) are involved. The STDDs such as on-load tap changers (OLTC) and FTCDs such as distributed generators should be coordinated in time sequence. Such VCC is formulated as a two-timescale optimization problem to jointly optimize FTCDs and STDDs in ADNs. Traditional optimization methods are heavily based on accurate models of the system, but sometimes impractical because of their unaffordable effort on modelling. In this paper, a novel bi-level off-policy reinforcement learning (RL) algorithm is proposed to solve this problem in a model-free manner. A Bi-level Markov decision process (BMDP) is defined to describe the two-timescale VVC problem and separate agents are set up for the slow and fast timescale sub-problems. For the fast timescale sub-problem, we adopt an off-policy RL method soft actor-critic with high sample efficiency. For the slow one, we develop an off-policy multi-discrete soft actor-critic (MDSAC) algorithm to address the curse of dimensionality with various STDDs. To mitigate the non-stationary issue existing the two agents' learning processes, we propose a multi-timescale off-policy correction (MTOPC) method by adopting importance sampling technique. Comprehensive numerical studies not only demonstrate that the proposed method can achieve stable and satisfactory optimization of both STDDs and FTCDs without any model information, but also support that the proposed method outperforms existing two-timescale VVC methods.

研究动机与目标

  • 解决在缺乏精确系统模型的前提下,协调主动配电网中慢时变离散设备(STDDs)与快时变连续设备(FTCDs)在电压/无功控制(VVC)中的挑战。
  • 克服传统基于模型的优化方法因建模工作量大、在快速演化的主动配电网(ADNs)中不切实际而带来的局限性。
  • 开发一种数据驱动、无模型的强化学习框架,实现对慢时变与快时变设备在两个不同时间尺度上的联合优化。
  • 在双智能体双层强化学习设置中稳定训练过程,其中慢速与快速智能体同时学习并相互干扰其经验分布。
  • 通过利用离策略算法与一种新颖的多时变校正机制,实现高样本效率与接近最优的性能表现。

提出的方法

  • 将双时变VVC问题建模为双层马尔可夫决策过程(BMDP),将慢速设备(STDDs)与快速设备(FTCDs)的控制分离为独立子问题。
  • 采用离策略软演员-critic(SAC)实现快速时变智能体(FTA),用于对DG和SVC等设备进行连续控制,提升样本效率。
  • 设计一种基于新型多离散软演员-critic(MDSAC)算法的慢速时变智能体(STA),通过分解值函数缓解离散动作空间中的维度灾难问题。
  • 提出一种基于重要性采样技术的多时变离策略校正(MTOPC)方法,校正STA与FGA之间的分布偏移,降低联合训练过程中的非平稳性。
  • 使用大小为24,000 FTA步长的回放缓冲区,并在基于PyTorch的框架中端到端训练智能体,采用小批量更新与随机权重初始化。
  • 应用MTOPC对回放缓冲区中的转移样本进行重加权,确保STA的策略更新基于来自FTA经验的校正期望,即使FTA策略已过时。

实验结果

研究问题

  • RQ1无模型、双层离策略强化学习框架能否有效协调电压/无功控制中慢时变离散设备与快时变连续设备?
  • RQ2在多智能体强化学习用于VVC时,如何缓解离散动作空间(如OLTC分接头位置、电容器投切)中的维度灾难问题?
  • RQ3当两个在不同时间尺度上运行的智能体因经验分布非平稳而相互干扰时,应采用何种机制来稳定其训练过程?
  • RQ4与基于模型或单时变DRL基线相比,无模型DRL方法在降低损失与改善电压特性方面能实现多大程度的性能提升?
  • RQ5与无校正的标准离策略训练相比,所提出的MTOPC方法是否显著提升了训练稳定性与收敛速度?

主要发现

  • 在33节点测试馈线中,所提方法实现网络有功功率损耗为8.30 × 10⁻² MW,优于S-DQN(6.05 × 10⁻² MW)与A-OPT(1.08 × 10⁻¹ MW),略高于最优解(oracle OPT,4.59 × 10⁻² MW)。
  • 该方法将电压越限率(VVR)降低至0 p.u.,与最优解一致,同时分接头操作次数仅为2.4,显著低于A-OPT(7.0)与S-DQN(4.3)。
  • 采用MTOPC后,方法在2,000 FTA步长内即达到接近最优性能,而非OPC变体则需显著更多样本,且在不同随机种子下表现出较高方差。
  • MTOPC校正权重ω′的均值在训练过程中趋于1.0,表明对过时FTA策略的校正有效,后期标准差较低。
  • STA所采用的MDSAC算法在稳定性和收敛速度上均优于DQN,证明其在处理高维离散动作空间中的有效性。
  • 无模型方法在未获知网络拓扑与参数的情况下实现具有竞争力的性能,而A-OPT与S-DQN则依赖于最优模型进行FTA优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。