[论文解读] Lessons Learned from Data-Driven Building Control Experiments: Contrasting Gaussian Process-based MPC, Bilevel DeePC, and Deep Reinforcement Learning
本文通过在多种建筑中的真实世界建筑控制实验,对比了基于高斯过程的模型预测控制(GP-MPC)、双层数据驱动预测控制(DeePC)以及深度强化学习(DRL)三种方法。评估内容涵盖数据效率、计算负载、鲁棒性及部署便捷性,结论指出:不存在一种方法在所有场景下均最优,最佳选择取决于数据可用性、系统复杂度及计算资源。
This manuscript offers the perspective of experimentalists on a number of modern data-driven techniques: model predictive control relying on Gaussian processes, adaptive data-driven control based on behavioral theory, and deep reinforcement learning. These techniques are compared in terms of data requirements, ease of use, computational burden, and robustness in the context of real-world applications. Our remarks and observations stem from a number of experimental investigations carried out in the field of building control in diverse environments, from lecture halls and apartment spaces to a hospital surgery center. The final goal is to support others in identifying what technique is best suited to tackle their own problems.
研究动机与目标
- 评估并对比三种现代数据驱动控制技术——GP-MPC、双层DeePC与DRL——在真实建筑控制应用中的表现。
- 识别每种方法在数据需求、计算复杂度、鲁棒性与易用性方面的优势与局限。
- 为研究人员和从业者提供实用指导,根据系统特性与可用资源选择最合适的基于数据的控制方法。
- 基于在医院、礼堂与公寓中的真实部署,提供实验洞见,强调实际应用价值而非理论性能。
提出的方法
- GP-MPC 使用高斯过程对建筑热力学动态进行建模,并量化不确定性,将预测均值与方差整合进滚动时域优化框架。
- 双层DeePC 利用行为系统理论,直接从数据中学习控制策略,无需显式模型结构,通过基于二次规划的优化实现,对扰动具有鲁棒性。
- DRL 使用深度神经网络从数据中端到端学习控制策略,智能体通过基于奖励的学习方式在离线阶段训练,实现从观测到动作的映射。
- 所有方法均在真实建筑中进行评估:一家医院的手术中心、一座礼堂(Polydome)以及NEST建筑中的公寓,使用来自多种环境条件的历史数据。
- 控制策略在数据效率、计算成本(离线与在线)、约束处理能力以及对扰动和未见数据的鲁棒性方面进行对比。
- GP-MPC 与 DeePC 使用天气预报进行预测,而 DRL 通过经验隐式预判未来状况,尽管可将预报信息加入观测以提升鲁棒性。
实验结果
研究问题
- RQ1在真实建筑控制场景中,GP-MPC、双层DeePC与DRL在数据效率与模型训练需求方面如何比较?
- RQ2在实际建筑控制部署中,各方法的计算负担(包括离线与在线阶段)如何?
- RQ3三种方法在扰动或未见条件下如何处理约束并保持鲁棒性?
- RQ4DRL 智能体在无显式预报的情况下对未见条件的泛化能力如何?与基于模型的方法相比有何差异?
- RQ5GP-MPC 中的不确定性估计与DeePC 中的鲁棒公式化在真实世界环境中如何提升控制可靠性?
主要发现
- GP-MPC 展现出高数据效率,在无GPU条件下仅需300个数据点即可在15至120秒内完成模型拟合,并提供不确定性估计,从而增强鲁棒性。
- DeePC 无需离线计算,部署最为简便,但仅适用于线性或近似线性系统,且其鲁棒公式化需仔细调参。
- DRL 需要大规模数据集,且离线训练可能长达数天(依赖GPU),但可通过神经网络单次前向传播实现近乎即时的在线推理,控制响应迅速。
- GP-MPC 在运行时计算最密集,每次控制更新需20秒,源于非凸优化,但考虑到典型的5至15分钟采样间隔,该开销可接受。
- 所有方法均成功实现了真实建筑中的温度控制,但DRL表现出违反约束的倾向,原因在于缺乏显式约束且对分布外数据敏感。
- GP-MPC 中的不确定性量化与DeePC 中的鲁棒双层公式化有助于防止约束违规,而DRL 智能体则需额外机制以确保安全运行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。