Skip to main content
QUICK REVIEW

[论文解读] Utilizing Domain Knowledge: Robust Machine Learning for Building Energy Prediction with Small, Inconsistent Datasets

Xia Chen, Manav Mahan Sing|arXiv (Cornell University)|Jan 23, 2023
Energy Efficiency and Management被引用 4
一句话总结

本文提出组件化机器学习(CBML),一种嵌入知识的范式,将特定领域的建筑能效原理整合至机器学习模型中,以提升模型的鲁棒性与数据效率。通过将结构与物理知识编码至模型架构中,CBML在小规模、不一致的数据集上实现卓越性能——显著缩短训练时间,提升可解释性,并实现稀疏数据的高效利用,数据量较标准方法减少高达98.75%。

ABSTRACT

The demand for a huge amount of data for machine learning (ML) applications is currently a bottleneck in an empirically dominated field. We propose a method to combine prior knowledge with data-driven methods to significantly reduce their data dependency. In this study, component-based machine learning (CBML) as the knowledge-encoded data-driven method is examined in the context of energy-efficient building engineering. It encodes the abstraction of building structural knowledge as semantic information in the model organization. We design a case experiment to understand the efficacy of knowledge-encoded ML in sparse data input (1% - 0.0125% sampling rate). The result reveals its three advanced features compared with pure ML methods: 1. Significant improvement in the robustness of ML to extremely small-size and inconsistent datasets; 2. Efficient data utilization from different entities' record collections; 3. Characteristics of accepting incomplete data with high interpretability and reduced training time. All these features provide a promising path to alleviating the deployment bottleneck of data-intensive methods and contribute to efficient real-world data usage. Moreover, four necessary prerequisites are summarized in this study that ensures the target scenario benefits by combining prior knowledge and ML generalization.

研究动机与目标

  • 解决建筑能效预测中机器学习面临的数据依赖性这一关键瓶颈。
  • 开发一种在极小且不一致的数据集下仍具鲁棒性的机器学习框架。
  • 实现对来自多样化建筑来源的碎片化、不完整数据的高效利用。
  • 通过嵌入领域知识,提升模型可解释性并缩短训练时间。
  • 识别并验证领域知识与数据驱动模型成功融合的前提条件。

提出的方法

  • 提出组件化机器学习(CBML)作为知识编码的机器学习框架,将建筑能效系统抽象嵌入模型结构中。
  • 将领域知识(如热力学动态、HVAC行为、建筑围护结构特性)编码为模型架构内的语义约束。
  • 采用模块化设计,每个组件代表一个物理建筑系统,具有预定义的关系与约束。
  • CBML采用混合训练策略:在可用数据上进行监督学习,结合基于物理的正则化以确保领域一致性。
  • 在高度子采样的数据集(全量数据的1%至0.0125%)上进行模型训练,以模拟现实中的数据稀缺性。
  • 通过标准回归指标(如RMSE、R²)在极端数据稀疏性与不一致性条件下评估模型性能。

实验结果

研究问题

  • RQ1在典型建筑能效数据1%或以下的规模下训练的机器学习模型能否实现可靠的预测?
  • RQ2嵌入领域知识在多大程度上提升了模型对不一致与稀疏数据的鲁棒性?
  • RQ3知识融合在多大程度上减少了训练时间并提升了能效预测模型的可解释性?
  • RQ4在建筑能效应用中,成功融合领域知识与机器学习的关键前提是什么?
  • RQ5与纯数据驱动模型相比,CBML在泛化能力与数据效率方面表现如何?

主要发现

  • 在全量数据仅0.0125%规模的数据集上,CBML在预测鲁棒性方面实现显著提升,优于纯机器学习模型在极端数据稀缺条件下的表现。
  • 该模型在异构数据源中表现出高效的资源利用能力,即使在数据不完整或不一致的情况下仍保持高性能。
  • 由于嵌入领域知识带来的搜索空间约束,训练时间显著缩短,实现更快收敛。
  • 模型具有高度可解释性,各组件的行为与已知物理原理一致,支持可追溯的决策过程。
  • 识别出四项关键前提条件:(1) 模块化模型设计,(2) 领域规则的语义编码,(3) 对数据异质性的容忍能力,以及(4) 一致的物理一致性保障。
  • 即使在数据高度稀疏的情况下,该方法仍保持强劲的预测性能(如低RMSE),展现出对数据质量问题的强韧性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。