Skip to main content
QUICK REVIEW

[论文解读] Autoencoder-based time series clustering with energy applications

Guillaume Richard, Benoît Grossin|arXiv (Cornell University)|Feb 10, 2020
Time Series Analysis and Forecasting参考文献 8被引用 10
一句话总结

本文提出了一种两阶段时间序列聚类方法,结合卷积自编码器(CAE)进行特征提取与k-medoids聚类,在合成数据和真实能耗数据上相比传统方法(如PCA和小波变换)展现出更强的抗异常值能力以及更精细的聚类分离效果。

ABSTRACT

Time series clustering is a challenging task due to the specific nature of the data. Classical approaches do not perform well and need to be adapted either through a new distance measure or a data transformation. In this paper we investigate the combination of a convolutional autoencoder and a k-medoids algorithm to perfom time series clustering. The convolutional autoencoder allows to extract meaningful features and reduce the dimension of the data, leading to an improvement of the subsequent clustering. Using simulation and energy related data to validate the approach, experimental results show that the clustering is robust to outliers thus leading to finer clusters than with standard methods.

研究动机与目标

  • 解决高维、噪声大且易受异常值影响的时间序列聚类挑战。
  • 通过使用卷积自编码器学习有意义的低维表示来提升聚类性能。
  • 实现稳健聚类,将异常值隔离为独立聚类,而非分散于多个组中。
  • 在住宅用户、中小企业(SME)及异常值客户的真实能耗数据上验证该方法。
  • 证明基于CAE的特征提取方法在聚类准确率和抗异常值能力方面优于传统方法(如PCA和小波变换)。

提出的方法

  • 采用两阶段方法:首先训练卷积自编码器将时间序列压缩至低维潜在空间,然后在潜在表示上应用k-medoids聚类。
  • 编码器使用多层卷积和全连接层,将输入时间序列 $x \in \mathbb{R}^T$ 映射至维度更低的潜在向量 $h \in \mathbb{R}^m$,其中 $m < T$。
  • 解码器通过转置卷积层从潜在向量重建原始时间序列,最小化重建损失 $\mathcal{L}(x, \hat{x})$。
  • 由于卷积层具有局部感受野和权重重用特性,潜在向量能够捕捉形状不变且抗噪的特征。
  • 使用局部异常因子(LOF)度量识别异常值,基于LOF得分的第95百分位数,将数据集中5%定义为异常值。
  • 聚类采用k-medoids方法,其对异常值具有鲁棒性,并可提供可解释的聚类中心。

实验结果

研究问题

  • RQ1卷积自编码器能否有效从时间序列数据中提取有意义的低维表示,以提升聚类效果?
  • RQ2在存在异常值的情况下,所提出的基于CAE的聚类方法相较于经典特征提取方法表现如何?
  • RQ3该方法能否将异常值隔离为单一、独立的聚类,而非分散于多个聚类中?
  • RQ4在真实能耗数据上,该方法是否能生成更具可解释性与更细粒度的聚类?
  • RQ5与PCA、小波变换及其他经典表示方法相比,CAE在聚类准确率和鲁棒性方面表现如何?

主要发现

  • 在合成数据中,CAE+K-medoids方法完美分离了住宅用户、SME用户和异常值三类,三组之间无任何误分类。
  • PCA成功分离了住宅用户与SME用户,但未能将异常值单独隔离,异常值被分散至各聚类中。
  • 其他方法(包括小波变换和DWT)未将异常值类单独分离,反而将主要类别之一分裂为两个聚类。
  • 在真实CER智能电表数据上,该方法成功识别出一个独特且高度分散的异常值聚类,占数据集的5%,通过LOF方法确定。
  • 其余数据被聚类为10至16个有意义的组,聚类中心显示出清晰的行为模式,如冬季峰值或圣诞节波动。
  • 当与经典特征提取器结合时,该方法在K-means和SOM上表现更优,表明CAE具备独特能力,可捕捉相关的时间模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。