Skip to main content
QUICK REVIEW

[논문 리뷰] Data Smashing 2.0: Sequence Likelihood (SL) Divergence For Fast Time Series Comparison

Yi Huang, Ishanu Chattopadhyay|arXiv (Cornell University)|2019. 09. 26.
Time Series Analysis and Forecasting참고 문헌 11인용 수 4
한 줄 요약

이 논문은 확률적 유한 상태 오토마타(PFSA)에서 유도된 시퀀스 가능성(SL) 발산을 기반으로 한 보편적이고 빠르며 특성 공학이 불필요한 시간 시리즈 비교를 위한 메트릭인 Smash2.0을 소개한다. 이 메트릭은 시간 시리즈의 기본 확률적 생성기 간의 발산을 측정하여 모델 수준의 유사도를 효율적으로 추정할 수 있으며, 합성 데이터 및 실제 EEG와 걸음걸이 데이터에서 기존의 동적 시간 왜곡(DTW) 및 원본 데이터 스매싱 기법보다 빠르고 정확도가 뛰어나다.

ABSTRACT

Recognizing subtle historical patterns is central to modeling and forecasting problems in time series analysis. Here we introduce and develop a new approach to quantify deviations in the underlying hidden generators of observed data streams, resulting in a new efficiently computable universal metric for time series. The proposed metric is in the sense that we can compare and contrast data streams regardless of where and how they are generated and without any feature engineering step. The approach proposed in this paper is conceptually distinct from our previous work on data smashing, and vastly improves discrimination performance and computing speed. The core idea here is the generalization of the notion of KL divergence often used to compare probability distributions to a notion of divergence in time series. We call this the sequence likelihood (SL) divergence, which may be used to measure deviations within a well-defined class of discrete-valued stochastic processes. We devise efficient estimators of SL divergence from finite sample paths and subsequently formulate a universal metric useful for computing distance between time series produced by hidden stochastic generators.

연구 동기 및 목표

  • 도메인 특화의 특성 공학이 필요 없는 보편적이고 계산 효율적인 시간 시리즈 비교 메트릭을 개발하는 것.
  • 기존 방법들이 낮은 포인트별 유사도에도 불구하고 동일한 확률적 과정으로 생성된 시간 시리즈를 구분하지 못하는 한계를 해결하는 것.
  • 새로운 발산 측정법인 시퀀스 가능성(SL) 발산을 통해 KL 발산을 확률적 과정으로 일반화하여 모델 수준의 유사도를 측정하는 것.
  • EEG 및 걸음걸이 데이터와 같은 다양한 출처의 시간 시리즈를 기반으로 그 기본 생성 과정의 유사성을 추정하여 강건한 분류 및 군집화를 가능하게 하는 것.
  • 정량화 및 PFSA 추론을 사용하여 원시 데이터 스트림에 직접 작용하는 확장 가능한 시간 시리즈 분석 프레임워크를 제공하는 것.

제안 방법

  • 시간 시리즈를 이산값을 가지는 확률적 과정의 실현으로 모델링하며, 이는 비-마르코프 동역학을 표현할 수 있는 확률적 유한 상태 오토마타(PFSA)를 사용한다.
  • SL 발산을 KL 발산을 확률적 과정으로 일반화한 것으로 정의하여 생성 모델 간의 편차를 정량화한다.
  • 유한 길이의 표본 경로에 대한 로그 가능도 수렴을 이용해 SL 발산을 효율적으로 추정하며, 고비용의 차원 축소를 피한다.
  • 연속적인 시간 시리즈 데이터를 유한 알파벳으로 매핑하기 위해 정량화 기법을 적용하여 PFSA 모델링에 적합한 형태로 변환한다.
  • 관측된 시퀀스에서 PFSA 모델을 학습하기 위해 GenESeSS 추론 알고리즘을 사용하여 엔트로피율과 KL 발산을 닫힌 형태로 추정할 수 있다.
  • 최종 메트릭인 Smash2.0은 SL 발산 기반으로 시간 시리즈 간의 쌍별 거리를 계산하여 후속 작업을 위한 보편적인 거리 행렬을 형성한다.

실험 결과

연구 질문

  • RQ1특성 공학이나 도메인 전문 지식이 필요 없이 시간 시리즈를 비교할 수 있는 보편적 메트릭을 개발할 수 있는가?
  • RQ2KL 발산을 어떻게 확률적 과정으로 일반화하여 샘플 경로 유사도가 아닌 모델 수준의 차이를 측정할 수 있는가?
  • RQ3유한 길이의 시간 시리즈에서 SL 발산을 효율적으로 추정할 수 있는가? 이를 통해 빠르고 정확한 시간 시리즈 비교가 가능한가?
  • RQ4기존의 DTW 및 원본 데이터 스매싱 기법과 비교해 새로운 메트릭의 성능은 속도와 분류 정확도 측면에서 어떻게 다른가?
  • RQ5복잡한 실제 시간 시리즈, 예를 들어 휴식 상태와 운동 상태에서의 EEG 패턴 또는 개인 간 걸음걸이 패턴의 미세한 차이를 효과적으로 식별할 수 있는가?

주요 결과

  • Smash2.0은 합성 시간 시리즈에서 원본 데이터 스매싱 및 동적 시간 왜곡(DTW)보다 분류 정확도가 뛰어나며, 계산 효율성 면에서도 크게 향상되었다.
  • EEG 데이터에서는 S004의 경우, 채널 21에서 r(D) = .572의 상관계수를 보이며 휴식 상태와 (가상의) 운동 상태 간의 뇌 상태 차이를 성공적으로 식별했으며, S001의 경우 임상적 기대와 일치하게 최소한의 차이를 보였다.
  • 걸음걸이 인식에서는 개인 간 다른 운동 패턴을 식별할 수 있었으며, z-방향에서 첫 두 참가자 간의 거리 행렬은 명확한 구분을 보이며 r(D) = .340를 기록하여 신뢰할 수 있는 사용자 식별이 가능했다.
  • 다중 채널 가속도계 데이터를 사용한 사용자 식별에서 높은 성능을 달성했으며, 방향별 측정값을 조합하고 채널 별 정량화 기법을 적용함으로써 단일 채널 접근 방식을 초월한 분류 정확도 향상을 이뤘다.
  • PFSA를 사용함으로써 엔트로피율과 KL 발산을 닫힌 형태로 계산할 수 있어, 유한한 표본 경로에서 SL 발산을 신속하고 안정적으로 추정할 수 있었다.
  • 원시 신호 특성 대신 기본 확률적 생성기 모델링을 통해 비정규적이고 비 stationary한 시간 시리즈를 포함한 다양한 데이터 유형에 대해 프레임워크가 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.