Skip to main content
QUICK REVIEW

[论文解读] LEAD1.0: A Large-scale Annotated Dataset for Energy Anomaly Detection in Commercial Buildings

Manoj Gulati, Pandarasamy Arjunan|arXiv (Cornell University)|Mar 30, 2022
Anomaly Detection Techniques and Applications被引用 5
一句话总结

本文介绍了LEAD1.0,这是一个大规模、全标注的数据集,包含1,413个商业建筑的电力表计时间序列,覆盖一年时间,且包含人工标注的异常。该研究对八种最先进的异常检测模型进行了基准测试,发现K-最近邻(KNN)模型的F1得分最高,达到0.431,证明了该数据集在训练和评估稳健能源异常检测系统方面的价值。

ABSTRACT

Modern buildings are densely equipped with smart energy meters, which periodically generate a massive amount of time-series data yielding few million data points every day. This data can be leveraged to discover the underlying loads, infer their energy consumption patterns, inter-dependencies on environmental factors, and the building's operational properties. Furthermore, it allows us to simultaneously identify anomalies present in the electricity consumption profiles, which is a big step towards saving energy and achieving global sustainability. However, to date, the lack of large-scale annotated energy consumption datasets hinders the ongoing research in anomaly detection. We contribute to this effort by releasing a well-annotated version of a publicly available ASHRAE Great Energy Predictor III data set containing 1,413 smart electricity meter time series spanning over one year. In addition, we benchmark the performance of eight state-of-the-art anomaly detection methods on our dataset and compare their performance.

研究动机与目标

  • 为解决商业建筑中能源消耗异常检测领域缺乏大规模、公开可用且标注完善的能源数据集这一关键问题。
  • 通过提供来自全球16个站点的多样化、真实世界建筑数据,支持机器学习模型更可靠、更具泛化能力的训练。
  • 通过提供高质量、人工验证的点异常和序列异常标签,降低异常检测中的误报率。
  • 支持可扩展、自动化的能源监控系统开发,以识别浪费性能源使用模式。

提出的方法

  • 该数据集源自公开的ASHRAE Great Energy Predictor III竞赛数据,聚焦于非住宅建筑的1,413个电力表计。
  • 通过结构化、多阶段的标注流程,由领域专家识别24小时能源使用模式中的点异常和序列异常。
  • 标注流程确保训练集、验证集和测试集之间无重叠,以防止数据泄露,并支持真实场景下的模型评估。
  • 使用LEAD1.0数据集对八种最先进的异常检测模型——KNN、LOF、孤立森林、OCSVM、CBLOF、HBOS、MCD和特征袋装——进行了基准测试。
  • 评估指标包括精确率、召回率和F1得分,基于70%的测试集计算,阈值在20%的验证集上进行优化。
  • 开发并发布了开源的基于网络的标注工具,以支持未来时间序列异常检测的数据标注工作。

实验结果

研究问题

  • RQ1现有最先进的异常检测模型在大规模、真实世界且全标注的能源消耗数据集上的表现如何?
  • RQ2当应用于多样化的商业建筑能源使用特征时,不同异常检测技术在精确率、召回率和F1得分方面的表现如何比较?
  • RQ3与无监督方法相比,人工标注的标签在多大程度上能降低能源异常检测中的误报率?
  • RQ4大规模、多站点、多建筑的数据集在多大程度上能提升机器学习模型在能源异常检测中的泛化能力?
  • RQ5所提出的标注流程在不同建筑类型和运行模式下,产生一致且可靠异常标签的有效性如何?

主要发现

  • K-最近邻(KNN)在LEAD1.0数据集上取得了0.431的最高F1得分,优于所有其他测试模型。
  • KNN的精确率也达到最高,为0.902,表明其在识别真实异常时具有极低的误报率,可靠性强。
  • 最小协方差确定(MCD)的精确率位居第二,达到0.901,显示出在异常值检测方面的优异性能。
  • 局部离群点因子(LOF)和KNN的召回率均约为0.281–0.284,表明其对真实异常的检测敏感度中等。
  • 基准测试结果表明,监督学习和统计模型(如KNN和MCD)在精确率方面显著优于其他模型,凸显了高质量标签的价值。
  • 开源标注工具和数据集的发布,推动了能源异常检测研究的可复现性与社区协作发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。