[论文解读] Towards Optimal District Heating Temperature Control in China with Deep Reinforcement Learning
本文提出一种深度强化学习(DRL)方法,用于优化中国二级管网的集中供热供水温度,采用循环神经网络(RNN)预测室内温度并训练DRL智能体。与优化后的基线相比,该智能体实现每季2.19%的节能和495吨二氧化碳减排,同时提升热舒适性。
Achieving efficiency gains in Chinese district heating networks, thereby reducing their carbon footprint, requires new optimal control methods going beyond current industry tools. Focusing on the secondary network, we propose a data-driven deep reinforcement learning (DRL) approach to address this task. We build a recurrent neural network, trained on simulated data, to predict the indoor temperatures. This model is then used to train two DRL agents, with or without expert guidance, for the optimal control of the supply water temperature. Our tests in a multi-apartment setting show that both agents can ensure a higher thermal comfort and at the same time a smaller energy cost, compared to an optimized baseline strategy.
研究动机与目标
- 为解决中国集中供热管网能源效率低下问题,其因过时的控制策略而成为碳排放的主要来源。
- 开发一种数据驱动的最优控制方法,用于二级管网温度调节,以提升热舒适性并降低能耗。
- 评估深度强化学习是否能在类似真实场景的仿真中优于传统的基于水温曲线的控制策略。
- 评估专家引导的动作空间对DRL智能体性能及实际部署可行性的影响。
- 证明仅基于热舒适性偏差的奖励函数即可实现节能,而无需显式引入能耗成本权重。
提出的方法
- 使用模拟数据训练循环神经网络(RNN),基于供水温度、室外温度、一天中的时间及历史测量数据预测室内温度。
- 采用深度Q网络(DQN)训练两个DRL智能体:智能体1使用相对于前一时刻供水温度的增量动作,智能体2使用相对于学习到的基线策略的偏差动作。
- 将环境建模为马尔可夫决策过程,状态向量包含室外温度、供水温度、一天中的时间以及24小时内的室内温度历史。
- 奖励函数对偏离目标室内温度(18 °C)的绝对偏差进行惩罚,不显式引入能耗成本权重:r = -Σ|T_in - T_target|。
- 训练使用中国七个城市的气象数据以避免过拟合,测试在第八个城市(运城)进行,以评估泛化能力。
- 基线策略采用经优化的水温曲线,经人工调优,代表当前工业实践。
实验结果
研究问题
- RQ1深度强化学习能否在能效和热舒适性方面优于中国集中供热系统中当前工业标准的水温曲线策略?
- RQ2专家引导的动作空间(智能体2)如何影响DRL智能体在真实部署场景中的性能与稳定性?
- RQ3仅基于热舒适性偏差的奖励函数在不引入显式能耗成本惩罚的情况下,能在多大程度上实现能耗降低?
- RQ4基于RNN的温度预测模型在不同气候条件下如何提升DRL智能体的鲁棒性与泛化能力?
- RQ5当将DRL应用于服务一万平方米规模的集中供热网络时,可能实现的二氧化碳与能耗节省是多少?
主要发现
- 在多套公寓的仿真中,智能体2相比优化后的基线策略,实现每季2.19%的节能和495吨二氧化碳减排。
- 两个DRL智能体相比基线,均将室内温度的平均绝对误差降低8.5%,其中智能体2误差最低(0.545 °C),标准差最小(0.692 °C)。
- 仅基于热舒适性偏差的奖励函数比加权权衡函数更稳定、更具鲁棒性,同时仍实现显著节能。
- 专家引导的动作空间(智能体2)提升了性能,并确保动作始终在专家基线的3 °C范围内,增强了操作员信任度与部署可行性。
- PID控制器性能略优于基线,但在能效和热舒适性方面均被两个DRL智能体超越。
- 结果表明,DRL能够有效学习集中供热系统中复杂的热力学动态,即使在供热价格固定、无储热设施的低灵活性环境中亦可实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。