[论文解读] Optimal Demand Response Using Device Based Reinforcement Learning
本文提出了一种基于设备的强化学习(RL)框架,用于住宅及小型商业建筑中的最优需求响应,无需预先指定用户不满函数。通过将能源管理系统(EMS)建模为设备集群上的去中心化强化学习问题,该方法实现了自主发起的任务调度与灵活的用户请求,实现了线性计算复杂度,并通过Q-learning仿真在不同成本-延迟权衡下展示了优越性能。
Demand response (DR) for residential and small commercial buildings is estimated to account for as much as 65% of the total energy savings potential of DR, and previous work shows that a fully automated Energy Management System (EMS) is a necessary prerequisite to DR in these areas. In this paper, we propose a novel EMS formulation for DR problems in these sectors. Specifically, we formulate a fully automated EMS's rescheduling problem as a reinforcement learning (RL) problem, and argue that this RL problem can be approximately solved by decomposing it over device clusters. Compared with existing formulations, our new formulation (1) does not require explicitly modeling the user's dissatisfaction on job rescheduling, (2) enables the EMS to self-initiate jobs, (3) allows the user to initiate more flexible requests and (4) has a computational complexity linear in the number of devices. We also demonstrate the simulation results of applying Q-learning, one of the most popular and classical RL algorithms, to a representative example.
研究动机与目标
- 为解决住宅及小型商业建筑中自动化需求响应的挑战,其中人工决策导致决策疲劳和参与度低。
- 消除显式建模用户对任务重调度不满的需要,这是先前研究中的主要局限。
- 开发一种支持自主发起任务(如HVAC、泳池加热器)和灵活用户请求的EMS公式。
- 在设备数量上实现线性计算复杂度,以实现可扩展性。
- 通过在代表性合成示例上使用Q-learning,证明所提出的基于强化学习的EMS的可行性与性能。
提出的方法
- 将EMS重调度问题建模为设备集群上的去中心化马尔可夫决策过程(MDP)。
- 将全局强化学习问题分解为设备集群级别的决策,以降低复杂度并实现可扩展性。
- 使用Q-learning作为核心强化学习算法,从与电价和用户请求的交互中学习最优调度策略。
- 将用户请求建模为具有时间依赖性取消概率的随机事件,且与优先级无关。
- 定义相对需求响应潜力(RDRP)指标,用于在不同成本-延迟权衡参数(γ)下评估系统性能。
- 实施带有温度参数η和探索率ε的softmin策略,以在训练期间平衡探索与利用。
实验结果
研究问题
- RQ1能否设计一种完全自动化的EMS,而无需为任务重调度显式建模用户不满函数?
- RQ2与从不重调度任务的基线策略相比,所提出的基于设备的强化学习公式性能如何?
- RQ3成本-延迟权衡参数γ的变化对系统相对改进(RI)有何影响?
- RQ4EMS能否在无显式用户请求的情况下学习自主发起任务?这对能源成本和用户延迟有何影响?
- RQ5所提出的方法在设备数量增加时是否能高效扩展,同时保持线性计算复杂度?
主要发现
- 所提出的基于强化学习的EMS在广泛的成本-延迟权衡参数范围内均优于基线策略(不重调度),当γ ≤ 4.3时,相对改进(RI)始终为正。
- 相对需求响应潜力(RDRP)随γ增加而单调递减,表明对重调度的更高偏好会降低系统实现收益的能力。
- 当γ = 0时,RDRP = 1;当γ → ∞时,RDRP趋近于0,验证了模型的理论边界。
- 仿真结果表明,Q-learning成功学习到最优调度策略,且RI随γ增加而减小,反映出重调度灵活性的降低。
- 该方法在设备集群数量上实现了线性计算复杂度,使其适用于实际部署的可扩展性。
- 该框架支持自主发起任务调度并支持灵活的用户请求,克服了先前方法的关键局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。