Skip to main content
QUICK REVIEW

[논문 리뷰] Autoencoder-based time series clustering with energy applications

Guillaume Richard, Benoît Grossin|arXiv (Cornell University)|2020. 02. 10.
Time Series Analysis and Forecasting참고 문헌 8인용 수 10
한 줄 요약

이 논문은 특징 추출에 컨volutional autoencoder(CAE)를 사용하고 k-medoids 군집화를 적용하는 이단계 시간 시리즈 군집화 방법을 제안하며, 기존의 PCA 및 웨이블릿과 같은 전통적 방법에 비해 이상치에 더 강건하고 더 세밀한 군집 분리 성능을 보여준다. 이는 합성 데이터와 실제 에너지 소비 데이터에서 입증되었다.

ABSTRACT

Time series clustering is a challenging task due to the specific nature of the data. Classical approaches do not perform well and need to be adapted either through a new distance measure or a data transformation. In this paper we investigate the combination of a convolutional autoencoder and a k-medoids algorithm to perfom time series clustering. The convolutional autoencoder allows to extract meaningful features and reduce the dimension of the data, leading to an improvement of the subsequent clustering. Using simulation and energy related data to validate the approach, experimental results show that the clustering is robust to outliers thus leading to finer clusters than with standard methods.

연구 동기 및 목표

  • 고차원적이고 노이즈가 많으며 이상치에 취약한 시간 시리즈 데이터 군집화 문제를 해결하기 위해.
  • 컨volutional autoencoder를 사용해 의미 있는 저차원 표현을 학습함으로써 군집 성능을 향상시키기 위해.
  • 이상치를 별도의 군집으로 분리하는 강건한 군집화를 가능하게 하기 위해.
  • 주거용, 소기업(SME), 이상치 고객으로부터의 실제 세계 에너지 소비 데이터를 바탕으로 방법을 검증하기 위해.
  • 군집 정확도와 이상치에 대한 내성에서 CAE 기반 특징 추출이 PCA 및 웨이블릿과 같은 전통적 방법보다 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 이중 단계 접근법: 먼저 시간 시리즈를 낮은 차원의 잠재 공간으로 압축하기 위해 컨volutional autoencoder를 훈련한 후, 잠재 표현에 대해 k-medoids 군집화를 수행한다.
  • 에코더는 입력 시간 시리즈 $x \in \mathbb{R}^T$ 를 $m < T$ 인 잠재 벡터 $h \in \mathbb{R}^m$ 로 매핑하기 위해 다수의 컨볼루션 및 완전 연결 계층을 사용한다.
  • 디코더는 복소화 계층을 사용해 잠재 벡터에서 원래 시간 시리즈를 재구성하며, 재구성 오차 $\mathcal{L}(x, \hat{x})$ 를 최소화한다.
  • 컨볼루션 계층의 국소적 수신장과 가중치 공유 덕분에 잠재 벡터는 형태 보존 및 노이즈에 강건한 특징을 포착한다.
  • 이상치는 局소 이상치 요인(Local Outlier Factor, LOF) 지표를 사용해 식별되며, LOF 점수의 95번째 백분위수 기준으로 데이터셋의 5%가 이상치로 정의된다.
  • 군집화는 이상치에 강건하고 중심점이 해석 가능한 k-medoids를 사용한다.

실험 결과

연구 질문

  • RQ1컨volutional autoencoder는 시간 시리즈 데이터로부터 의미 있는 저차원 표현을 효과적으로 추출하여 군집화 성능을 향상시킬 수 있는가?
  • RQ2제안된 CAE 기반 군집화 방법은 기존의 특징 추출 방법에 비해 이상치 존재 조건에서 어떻게 성능을 발휘하는가?
  • RQ3이 방법은 이상치를 별도의 군집으로 분리할 수 있는가, 아니면 여러 군집에 흩어지게 하는가?
  • RQ4CAE 기반 접근법은 실제 에너지 소비 데이터에서 더 해석 가능하고 세분화된 군집을 도출할 수 있는가?
  • RQ5군집 정확도와 내성에서 CAE는 PCA, 웨이블릿 및 기타 전통적 표현 방식에 비해 어떻게 성능을 발휘하는가?

주요 결과

  • CAE+K-medoids 방법은 합성 데이터에서 주거용, 소기업(SME), 이상치 고객 클래스를 완벽하게 분리하며, 세 그룹 간에 잘못 분류된 사례가 전혀 없었다.
  • PCA는 주거용 및 소기업 고객을 성공적으로 분리하지만 이상치를 분리하지 못하며, 군집에 흩어져 있다.
  • 웨이블릿 및 DWT를 포함한 다른 방법들은 이상치 클래스를 분리하지 못하고, 오히려 주요 군집 중 하나를 두 개의 군집으로 나누고 있다.
  • 실제 CER 스마트 미터링 데이터에서는 LOF를 통해 식별된 5%의 데이터가 포함된 별도의 고도로 산산이 흩어진 이상치 군집이 존재한다.
  • 나머지 데이터는 10~16개의 의미 있는 군집으로 분류되며, 중심점은 겨울 정점 또는 크리스마스 정점과 같은 명확한 행동 패tern을 보여준다.
  • 클래식한 특징 추출기와 결합했을 때 K-means 및 SOM보다 성능이 뛰어나, CAE가 관련된 시간 패턴을 포착하는 데 독특한 능력을 지녔음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.