Skip to main content
QUICK REVIEW

[论文解读] Gradient boosting machines and careful pre-processing work best: ASHRAE Great Energy Predictor III lessons learned

Clayton Miller, Hao Liu|arXiv (Cornell University)|Feb 7, 2022
Energy Load and Power Forecasting被引用 4
一句话总结

本文分析了ASHRAE Great Energy Predictor III竞赛中表现最佳的解决方案,揭示了梯度提升机(尤其是LightGBM)结合细致的特征工程与预处理,在长期建筑能效预测中实现了最高精度。研究指出,数据预处理和特征提取是最重要的阶段,而Python和Jupyter笔记本则是顶尖团队中占主导地位的工具。

ABSTRACT

The ASHRAE Great Energy Predictor III (GEPIII) competition was held in late 2019 as one of the largest machine learning competitions ever held focused on building performance. It was hosted on the Kaggle platform and resulted in 39,402 prediction submissions, with the top five teams splitting $25,000 in prize money. This paper outlines lessons learned from participants, mainly from teams who scored in the top 5% of the competition. Various insights were gained from their experience through an online survey, analysis of publicly shared submissions and notebooks, and the documentation of the winning teams. The top-performing solutions mostly used ensembles of Gradient Boosting Machine (GBM) tree-based models, with the LightGBM package being the most popular. The survey participants indicated that the preprocessing and feature extraction phases were the most important aspects of creating the best modeling approach. All the survey respondents used Python as their primary modeling tool, and it was common to use Jupyter-style Notebooks as development environments. These conclusions are essential to help steer the research and practical implementation of building energy meter prediction in the future.

研究动机与目标

  • 识别ASHRAE Great Energy Predictor III竞赛中顶尖团队所采用的最有效的机器学习技术与工作流程。
  • 理解数据预处理与特征工程在实现长期建筑能效预测高精度中的作用。
  • 评估高分团队在竞赛中偏好的工具、编程语言与开发环境。
  • 探讨建筑环境专业人士在数据科学领域面临的技术门槛,并提出推动机器学习在建筑能效研究中更广泛应用的路径。
  • 为未来的机器学习竞赛及建筑能效性能预测的实际应用提供可操作的见解。

提出的方法

  • 对ASHRAE GEPIII排行榜前5%的50名参赛者中的27名个体进行了赛后调查,重点关注人口统计、建模工作流程与工具偏好。
  • 分析了公开分享的笔记本、竞赛提交结果及获奖团队的文档,以验证调查结果并提取顶尖解决方案的技术细节。
  • 分析聚焦于五阶段机器学习工作流程:数据预处理、特征工程、模型选择、超参数调优与集成堆叠。
  • 识别出LightGBM为最广泛使用的梯度提升框架,采用多种GBM模型组合的集成方法表现出更优性能。
  • 评估了数据多样性的影响,包括引入额外的行为与情境数据源对模型泛化能力与精度的影响。
  • 利用参与者的定性反馈评估竞赛设计偏好,并识别建筑环境领域非专家从业者在采用机器学习工具时面临的挑战。

实验结果

研究问题

  • RQ1在不同建筑类型与气候条件下,哪些机器学习模型与算法在长期建筑能效预测中实现了最高精度?
  • RQ2与模型架构或超参数调优相比,数据预处理与特征工程在提升模型性能方面起到了多大程度的贡献?
  • RQ3顶尖团队最常使用的工具与开发环境是什么?它们如何影响解决方案的质量?
  • RQ4哪些关键障碍阻碍了建筑环境专业人士参与数据科学与机器学习在建筑能效研究中的应用?
  • RQ5开放数据集与共享代码笔记本如何有助于弥合数据科学与建筑能效专业人士之间的差距?

主要发现

  • 表现最佳的解决方案主要由梯度提升机(GBM)模型的集成构成,其中LightGBM是最受欢迎且最有效的实现方式。
  • 调查受访者一致认为,数据预处理与特征工程是建模流程中最重要的阶段,其重要性超过模型选择与超参数调优。
  • 所有受访者均使用Python作为主要编程语言,Jupyter风格笔记本是模型原型设计与知识共享的主导开发环境。
  • 尽管开源代码与数据集已公开,建筑环境专业人士在顶尖选手中的代表性仍然不足,表明在数据科学应用方面存在技能鸿沟。
  • 获奖解决方案大多已开源,为初学者与希望将现代数据科学技术应用于建筑能效数据的从业者提供了宝贵的学乆资源。
  • 研究发现,模型精度对数据质量与特征表示极为敏感,提升数据广度与上下文信息可显著增强预测性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。