[论文解读] Batch-Constrained Reinforcement Learning for Dynamic Distribution Network Reconfiguration
本文提出批次约束软演员-critic算法(BCSAC),一种基于历史运行数据、无需与环境交互的动态配电网络重构数据驱动强化学习算法。该方法通过KL正则化和批次约束减少外推误差,在三个测试系统上实现了优于最先进强化学习与模型基方法的性能,并具备实时可扩展性。
Dynamic distribution network reconfiguration (DNR) algorithms perform hourly status changes of remotely controllable switches to improve distribution system performance. The problem is typically solved by physical model-based control algorithms, which not only rely on accurate network parameters but also lack scalability. To address these limitations, this paper develops a data-driven batch-constrained reinforcement learning (RL) algorithm for the dynamic DNR problem. The proposed RL algorithm learns the network reconfiguration control policy from a finite historical operational dataset without interacting with the distribution network. The numerical study results on three distribution networks show that the proposed algorithm not only outperforms state-of-the-art RL algorithms but also improves the behavior control policy, which generated the historical operational data. The proposed algorithm is also very scalable and can find a desirable network reconfiguration solution in real-time.
研究动机与目标
- 解决基于模型的动态配电网络重构(DNR)方法的局限性,这些方法需要精确的网络参数,且可扩展性差。
- 克服从有限历史数据集中学习有效控制策略的挑战,标准强化学习方法在外推误差方面表现较高。
- 开发一种数据驱动、可扩展且具备实时能力的DNR解决方案,其性能优于生成历史数据的行为策略。
- 通过引入KL散度正则化和批次约束,确保在批次强化学习中满足约束条件并保持策略稳定性。
- 在具有不同复杂度的实际配电网络测试案例中,验证所提方法的可行性与优越性。
提出的方法
- 将动态DNR建模为基于有限历史数据集(网络状态与动作)的批次强化学习问题。
- 提出一种新型批次约束软演员-critic(BCSAC)算法,通过KL散度约束策略更新以逼近行为策略,同时最大化期望累积折扣回报。
- 引入一种增强奖励函数,包含KL正则化项:$ r^{ au}(s,a) = r(s,a) - au \text{KL}[ ilde{\rho}(\theta)(a|s) || \rho^b(a|s)] $,以稳定学习并减少外推误差。
- 采用软演员-critic框架,其双重优化目标为:最大化期望回报并最小化与行为策略的差异。
- 利用压缩映射论证,证明在所提出的算子 $ \tilde{\tau}^{\tau} $ 下价值函数更新的收敛性,确保学习动态稳定。
- 应用带批次约束的策略迭代,其中每次策略更新均被限制在靠近行为策略的范围内,从而提升泛化能力与样本效率。
实验结果
研究问题
- RQ1无须与真实系统交互,基于数据驱动的批次强化学习方法是否能在动态配电网络重构中超越最先进强化学习与模型基方法?
- RQ2批次强化学习算法在多大程度上能改进生成历史数据的行为策略?
- RQ3在有限的历史配电网络重构数据上学习时,KL正则化在缓解外推误差方面的有效性如何?
- RQ4所提方法是否能在不同规模与复杂度的配电网络中实现实时性能与可扩展性?
- RQ5批次约束形式是否能在不确定性和数据不完整条件下确保稳定且可行的策略学习?
主要发现
- 所提出的BCSAC算法在全部三个测试配电网络中,总成本降低方面优于最先进强化学习算法。
- BCSAC优于生成历史数据的行为策略,表明所学策略的泛化能力优于原始运行策略。
- 该算法实现了显著低于传统模型基控制器的计算时间,具备实时性能,支持实际部署。
- 由于KL正则化与批次约束机制,该方法保持了高水平的约束满足度(如辐射状结构与电压限值)。
- 数值结果表明,与基线方法相比,BCSAC在高不确定性条件下更有效地降低了网络损耗与分布式发电(DG)弃用率。
- 理论分析证实,在所提出的批次约束框架下,价值函数收敛且所学策略具有最优性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。