Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed and parallel time series feature extraction for industrial big data applications

Maximilian Christ, Andreas W. Kempa-Liehr|arXiv (Cornell University)|2016. 10. 25.
Fault Detection and Control Systems참고 문헌 14인용 수 233
한 줄 요약

논문은 산업 빅데이터에서 분류 또는 회귀를 위한 관련 특징을 선택하기 위해 비모수 가설 검정과 Benjamini-Yekutieli FDR 제어를 사용하는 확장 가능하고 특징 기반의 시계열 추출 및 필터링 방법인 FRESH를 도입한다.

ABSTRACT

The all-relevant problem of feature selection is the identification of all strongly and weakly relevant attributes. This problem is especially hard to solve for time series classification and regression in industrial applications such as predictive maintenance or production line optimization, for which each label or regression target is associated with several time series and meta-information simultaneously. Here, we are proposing an efficient, scalable feature extraction algorithm for time series, which filters the available features in an early stage of the machine learning pipeline with respect to their significance for the classification or regression task, while controlling the expected percentage of selected but irrelevant features. The proposed algorithm combines established feature extraction methods with a feature importance filter. It has a low computational complexity, allows to start on a problem with only limited domain knowledge available, can be trivially parallelized, is highly scalable and based on well studied non-parametric hypothesis tests. We benchmark our proposed algorithm on all binary classification problems of the UCR time series classification archive as well as time series from a production line optimization project and simulated stochastic processes with underlying qualitative change of dynamics.

연구 동기 및 목표

  • 산업 환경에서 다변량 시계열의 효율적이고 확장 가능한 특징 추출 및 선택을 동기화한다.
  • 설립된 특징 매핑과 중요성-필터링 단계를 결합한 특징 추출 프레임워크를 제안한다.
  • 큰 특징 세트와 데이터 세트에서 특징 추출을 잘못 선택하는 경우의 오류를 제어한다.
  • 분산 데이터 환경에 적합한 병렬 구현이 가능하도록 한다.

제안 방법

  • 다변량 시계열 데이터에 대해 111개의 시계열 특징 매핑을 적용한다.
  • 타깃(이진 또는 연속)에 대한 관련성을 평가하기 위해 각 특징에 대해 전용 가설 검정을 수행한다.
  • 데이터 도메인에 맞춘 비모수 검정(Fisher, KS, Kendall)을 사용해 p-값을 계산한다.
  • Benjamini-Yekutieli 절차로 특징 p-값을 집계하여 잘못 추출된 특징의 비율(FER)을 제어한다.
  • 특징의 중복성을 줄이기 위한 PCA 기반 차원 축소를 제공하는 변형(FRESH_PCAb, FRESH_PCAa)
  • 대규모 데이터 맥락에서 확장성을 보장하기 위한 병렬화와 분산 계산을 논의한다.

실험 결과

연구 질문

  • RQ1보편적이고 확장 가능한 특징 추출 파이프라인이 대규모 시계열 특징 세트에서 최첨단 형태 기반 메서드와 경쟁할 수 있는가?
  • RQ2가설 검정 기반의 특징 선택 방법(FRESH)이 산업 빅데이터에서 잘못 발견을 제어하면서 예측 성능을 향상시키는가?
  • RQ3PCA 기반의 중복 축소가 특징 선택 및 분류 정확도에 미치는 영향은 무엇인가?
  • RQ4FRESH가 UCR 시계열 아카이브 및 산업 생산 데이터 등 다양한 데이터 세트에서 어떻게 성능을 발휘하는가?
  • RQ5대규모 시계열 분석을 위한 분산/병렬 구현에 이 방법이 적합한가?

주요 결과

  • FRESH 및 그 PCA 변형은 다수의 데이터 세트에서 AdaBoost와 DTW_NN과 경쟁력 있는 정확도를 달성하며, 일부 UCR 및 산업 데이터 작업에서 베이스라인 중 일부를 능가한다.
  • 가장 성능이 좋은 분류기는 AdaBoost 및 DTW_NN으로 평가에서 32개 데이터 세트 중 21개(UCR에서 모두)에 대해 최고의 평균 정확도를 달성했다.
  • FRESH 기반 파이프라인은 데이터 세트 전반에 걸쳐 Random Forest 분류기의 정확도를 개선하거나 유지하면서 특징 세트 크기를 줄인다.
  • 모든 특징 기반 방법은 시계열 길이에 따라 선형으로 확장되며, FRESH 및 FRESH_PCAa는 특징 수에 따라 선형으로 확장되어 빅 데이터 확장성을 지원한다.
  • FRESH는 분산 및 병렬화가 가능하도록 설계되었으며 FER은 종속 가설에 대해 Benjamini-Yekutieli 절차로 제어된다.
  • iPRODICT 산업 데이터에서 Boruta 기반 접근법이 특징 필터링 방법들 중 평균 정확도에서 가장 높았으며(약 72%), 필터링 없이 AdaBoost도 여전히 경쟁력이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.