Skip to main content
QUICK REVIEW

[论文解读] Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks

Yuanqi Gao, Wang Wei|arXiv (Cornell University)|Jul 6, 2020
Optimal Power Flow Distribution参考文献 30被引用 5
一句话总结

本文提出了一种共识多智能体深度强化学习(C-MARL)算法,用于主动配电网中的电压-无功(Volt-VAR)控制,实现了无需依赖网络拓扑或参数知识的去中心化、无模型控制。该方法在最大熵强化学习框架内采用通信高效的共识策略,性能与集中式强化学习相当,同时对智能体和通信链路故障表现出强鲁棒性。

ABSTRACT

Volt-VAR control (VVC) is a critical application in active distribution network management system to reduce network losses and improve voltage profile. To remove dependency on inaccurate and incomplete network models and enhance resiliency against communication or controller failure, we propose consensus multi-agent deep reinforcement learning algorithm to solve the VVC problem. The VVC problem is formulated as a networked multi-agent Markov decision process, which is solved using the maximum entropy reinforcement learning framework and a novel communication-efficient consensus strategy. The proposed algorithm allows individual agents to learn a group control policy using local rewards. Numerical studies on IEEE distribution test feeders show that our proposed algorithm matches the performance of single-agent reinforcement learning benchmark. In addition, the proposed algorithm is shown to be communication efficient and resilient.

研究动机与目标

  • 开发一种去中心化、数据驱动的电压-无功控制方法,无需精确的网络模型或集中协调。
  • 提升系统对集中式控制架构中常见的单个智能体或通信链路故障的鲁棒性。
  • 与现有基于共识的方法(如ADMM)相比,降低通信开销,同时保持高性能控制。
  • 通过局部奖励和价值函数对齐实现多智能体协调,避免依赖全局状态信息。
  • 在标准IEEE配电网测试馈线中,于真实故障场景下验证该方法,并与集中式强化学习基准进行对比。

提出的方法

  • 将电压-无功控制问题建模为具有每个智能体局部奖励的网络化多智能体马尔可夫决策过程(MMDP)。
  • 采用最大熵强化学习框架,以促进探索并提高样本效率。
  • 提出一种新型通信高效的共识策略,通过基于随机化的协议对齐智能体的价值函数。
  • 每个智能体训练两个深度神经网络:一个用于近似全局状态值函数,另一个用于学习本地策略。
  • 使用共识目标,最小化相邻智能体间价值函数的差异,以实现协调学习。
  • 采用去中心化训练方案,智能体基于本地观测和与邻居的有限通信更新其策略。

实验结果

研究问题

  • RQ1多智能体深度强化学习方法是否能在不依赖完整网络模型的情况下,实现与集中式强化学习相当的电压-无功控制性能?
  • RQ2所提出的共识策略在通信效率方面与现有通信密集型方法(如ADMM)相比如何?
  • RQ3所提出的C-MARL算法在实时运行中对单个智能体或通信链路故障的鲁棒性如何?
  • RQ4局部奖励最大化与价值函数共识相结合,是否能实现去中心化电压-无功控制中的有效全局协调?
  • RQ5该方法在具有分布式能源资源的主动配电网典型高维状态空间下是否仍能保持性能?

主要发现

  • 所提出的C-MARL算法在IEEE配电网测试馈线上实现了与单智能体深度强化学习基准相当的电压-无功控制性能。
  • 该算法对智能体故障和通信链路中断表现出高度鲁棒性,长期性能仅出现轻微下降。
  • 与基于ADMM的共识方案相比,通信开销显著降低,适用于大规模、实时部署。
  • 该方法无需网络拓扑或参数信息,仅依赖运行数据和本地交互。
  • 共识机制有效对齐了智能体的价值函数,即使在通信受限条件下也能实现协调控制。
  • 数值研究显示,若元件清除时间不过长,故障条件下的性能损失可忽略,证实了其在动态环境中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。