Skip to main content
QUICK REVIEW

[论文解读] Clustering electricity consumers using high-dimensional regression mixture models

Émilie Devijver, Yannig Goude|arXiv (Cornell University)|Jul 1, 2015
Bayesian Methods and Mixture Models参考文献 5被引用 8
一句话总结

本文提出一种基于模型的聚类方法,利用高维回归混合模型,仅通过两天的半小时智能电表数据,识别出不同的用户负荷模式。通过将每位用户每日的负荷建模为具有外生变量(如前一天的负荷、温度)的回归模型,该方法揭示了具有物理可解释性的聚类,支持高精度的负荷画像与自下而上的预测,且仅需极少数据。

ABSTRACT

Massive informations about individual (household, small and medium enterprise) consumption are now provided with new metering technologies and the smart grid. Two major exploitations of these data are load profiling and forecasting at different scales on the grid. Customer segmentation based on load classification is a natural approach for these purposes. We propose here a new methodology based on mixture of high-dimensional regression models. The novelty of our approach is that we focus on uncovering classes or clusters corresponding to different regression models. As a consequence, these classes could then be exploited for profiling as well as forecasting in each class or for bottom-up forecasts in a unified view. We consider a real dataset of Irish individual consumers of 4,225 meters, each with 48 half-hourly meter reads per day over 1 year: from 1st January 2010 up to 31st December 2010, to demonstrate the feasibility of our approach.

研究动机与目标

  • 解决智能电网中基于高维时间序列电力消耗数据的客户细分挑战。
  • 开发一种聚类方法,基于潜在的回归结构而非原始消耗形态,识别出不同的负荷模式。
  • 通过将用户分组为具有相似回归动态的聚类,实现负荷画像与自下而上的预测。
  • 通过仅使用500户爱尔兰居民用户两天的半小时数据,证明方法的可行性与准确性。
  • 表明基于短期数据得出的聚类在不同季节和一周中不同日期下仍保持物理可解释性与预测实用性。

提出的方法

  • 采用基于模型的聚类方法,使用有限混合的高维回归模型,其中每个分量代表一种独特的用户行为类别。
  • 每位用户的日负荷曲线被建模为回归形式:$ Y_d = X_d\beta + \varepsilon_d $,其中 $ X_d $ 包含滞后负荷、温度及其他外生变量。
  • 在每个混合分量中应用Lasso进行变量选择,以识别相关预测变量并降低维度。
  • 使用贝叶斯信息准则(BIC)进行模型选择,以确定最优聚类数与模型复杂度。
  • 该方法应用于更大爱尔兰数据集中500户居民用户的样本(共4,225个电表),使用冬季与夏季连续两天的数据。
  • 通过比较基于周二至周三数据训练的模型,预测周四负荷时的RMSE,评估预测性能,对比有无聚类的情况。

实验结果

研究问题

  • RQ1基于高维回归模型的聚类能否有效从仅两天的半小时数据中识别出不同的用户负荷模式?
  • RQ2所得聚类是否表现出具有物理可解释性的负荷行为,例如工作日与周末模式,或对温度的敏感性?
  • RQ3与全局线性模型相比,所识别的聚类是否能提高预测精度,特别是在自下而上的预测框架中?
  • RQ4当应用于偏移数据(如从周三预测周四)时,聚类的稳定性如何?
  • RQ5冬季与夏季的聚类结构有何不同?工作日与周末的聚类结构有何差异?

主要发现

  • 仅使用两天冬季数据,该方法成功识别出两到五个具有物理可解释性的聚类,包括明显的工作日与周末模式。
  • 聚类结果表明,工作日之间的转换(如周二至周三)比工作日与周末之间的转换更相似,支持使用工作日特定模型。
  • 在预测周四负荷时,基于模型的聚类方法相比全局线性模型与非聚类替代方案,均表现出更小的中位数RMSE与四分位距。
  • 当应用于偏移数据(如周三至周四)时,该方法保持稳健,连续工作日间维持一致的聚类结构。
  • 在夏季,聚类与冬季不同,周末出现显著的“无负荷”聚类,反映出用户外出等行为特征。
  • 聚类中心的日均负荷模式显示出明显的季节性与温度依赖性行为,冬季数据中在约0°C附近出现明显拐点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。