[论文解读] Performance Comparison of Deep RL Algorithms for Energy Systems Optimal Scheduling
本文评估了深度强化学习(DRL)算法——DDPG、TD3、SAC 和 PPO——在能源系统实时最优调度中的表现。结果表明,PPO 在平衡运行成本与技术约束方面优于其他 DRL 方法,尽管所有算法在高负荷峰值情况下均面临可行性问题,凸显了在基于 DRL 的能源管理中改进约束执行机制的必要性。
Taking advantage of their data-driven and model-free features, Deep Reinforcement Learning (DRL) algorithms have the potential to deal with the increasing level of uncertainty due to the introduction of renewable-based generation. To deal simultaneously with the energy systems' operational cost and technical constraints (e.g, generation-demand power balance) DRL algorithms must consider a trade-off when designing the reward function. This trade-off introduces extra hyperparameters that impact the DRL algorithms' performance and capability of providing feasible solutions. In this paper, a performance comparison of different DRL algorithms, including DDPG, TD3, SAC, and PPO, are presented. We aim to provide a fair comparison of these DRL algorithms for energy systems optimal scheduling problems. Results show DRL algorithms' capability of providing in real-time good-quality solutions, even in unseen operational scenarios, when compared with a mathematical programming model of the energy system optimal scheduling problem. Nevertheless, in the case of large peak consumption, these algorithms failed to provide feasible solutions, which can impede their practical implementation.
研究动机与目标
- 评估基于策略的深度强化学习(DRL)算法在求解实时能源系统最优调度问题中的性能。
- 研究基于惩罚的奖励函数设计对约束满足的影响,特别是功率平衡和电网输出/输入限制。
- 将 DRL 算法在未见运行场景下的鲁棒性与可行性与数学规划基准进行比较。
- 识别影响解质量与约束执行的关键超参数——尤其是惩罚系数 σ₂。
- 评估基于 DRL 的调度在具有技术约束的实际能源系统中的实际可行性。
提出的方法
- 将能源系统调度问题建模为具有连续动作和状态空间的马尔可夫决策过程(MDP)。
- 设计了一个结合运行成本最小化与惩罚项的奖励函数,用于功率不平衡,使用系数 σ₁ 和 σ₂ 平衡权衡。
- 实现了四种最先进的 DRL 算法:DDPG、TD3、SAC 和 PPO,全部采用深度神经网络进行函数逼近。
- 使用混合整数二次规划(MIQP)模型作为最优解质量与约束可行性的基准。
- 对惩罚系数 σ₂ 进行敏感性分析,以评估其对功率不平衡与运行成本的影响。
- 在不同电网输出/输入限制(P̄ᶜ)和不同 σ₂ 值(20、50、100)下,对 10 个时间步的性能进行评估。
实验结果
研究问题
- RQ1在实时约束下,DRL 算法(DDPG、TD3、SAC、PPO)在能源系统最优调度中的性能如何比较?
- RQ2奖励函数中的惩罚系数 σ₂ 对功率平衡与运行成本有何影响?
- RQ3提高电网输出/输入功率限制如何影响基于 DRL 的调度的可行性与性能?
- RQ4DRL 算法能否在未见运行场景下保持约束可行性的同时实现良好泛化?
- RQ5哪种 DRL 算法在能源调度中实现了成本最小化与约束执行之间的最佳平衡?
主要发现
- PPO 在运行成本与约束满足方面优于 DDPG、TD3 和 SAC,尤其在高负荷峰值情况下表现更优。
- 将惩罚系数 σ₂ 从 20 提高到 100 显著降低了功率不平衡,PPO 和 SAC 在 σ₂ = 100 时实现接近零的不平衡。
- DDPG 和 TD3 对 σ₂ 的敏感性低于 PPO 和 SAC,表现出在所有取值下一致的不平衡降低趋势。
- 所有 DRL 算法在大峰值负荷场景下均无法提供可行解,表明其在实际部署中存在关键局限性。
- 电网输出/输入限制(P̄ᶜ)显著影响解的可行性,更高的限制提升了动作空间的灵活性。
- 尽管具备良好的泛化能力和实时性能,DRL 方法相比基于模型的优化仍缺乏安全性保证,尤其在强制执行如功率平衡等等式约束方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。