Skip to main content
QUICK REVIEW

[논문 리뷰] Comparative Analysis of the Hidden Markov Model and LSTM: A Simulative Approach

Manie Tadayon, Greg Pottie|arXiv (Cornell University)|2020. 08. 09.
Time Series Analysis and Forecasting인용 수 4
한 줄 요약

이 논문은 다양한 복잡도 수준에서 합성 데이터를 사용하여 시간 시리즈 예측에 대해 은닉 마르코프 모델(HMM)과 장단기 기억(LSTM) 네트워크를 비교한다. 레이블이 부족한 경우 비지도 및 지도 학습 HMM이 LSTM보다 뛰어난 성능을 보이며, HMM은 훨씬 적은 파라미터를 요구하고, 일阶 마르코프 가정이 위반되더라도 강력한 정확도를 유지한다.

ABSTRACT

Time series and sequential data have gained significant attention recently since many real-world processes in various domains such as finance, education, biology, and engineering can be modeled as time series. Although many algorithms and methods such as the Kalman filter, hidden Markov model, and long short term memory (LSTM) are proposed to make inferences and predictions for the data, their usage significantly depends on the application, type of the problem, available data, and sufficient accuracy or loss. In this paper, we compare the supervised and unsupervised hidden Markov model to LSTM in terms of the amount of data needed for training, complexity, and forecasting accuracy. Moreover, we propose various techniques to discretize the observations and convert the problem to a discrete hidden Markov model under stationary and non-stationary situations. Our results indicate that even an unsupervised hidden Markov model can outperform LSTM when a massive amount of labeled data is not available. Furthermore, we show that the hidden Markov model can still be an effective method to process the sequence data even when the first-order Markov assumption is not satisfied.

연구 동기 및 목표

  • HMM과 LSTM의 시간 시리즈 예측 성능, 데이터 효율성, 모델 복잡도를 평가하고 비교한다.
  • 레이블이 부족한 경우 비지도 HMM이 레이블이 많은 지도 학습 딥러닝 모델(LSTM 등)과 경쟁 가능한 정확도를 달성할 수 있는지 조사한다.
  • 연속 관측값을 이산화하여 연속 HMM을 이산 HMM으로 전환하는 데에 효과적인 훈련 효율성과 해석 가능성 향상을 위한 방법을 개발하고 검증한다.
  • 상태 간 의존성이 한 단계를 초과하는 비정상적 및 비마르코프 조건 하에서 HMM의 강건성을 평가한다.
  • 모델 기반(HMM)과 데이터 기반(LSTM) 접근 방식 간의 데이터 요구량, 파라미터 수, 예측 정확도 간의 상호 교환 관계에 대한 실증적 증거를 제공한다.

제안 방법

  • 일阶 마르코프 가정을 위반하는 경우를 포함한 다양한 동적 베이지안 네트워크(DBN) 구조를 가진 합성 시간 시리즈 데이터를 생성하였다.
  • 기대값 최대화(EM) 알고리즘을 사용하여 비지도 및 지도 학습 방식으로 이산 HMM(DHMM) 및 연속 HMM(CHMM)을 구현하였다.
  • 정상 및 비정상 상황 모두에 적용 가능한 히스토그램 빈 분할 기반의 연속 관측값 이산화 전략을 제안하였다.
  • 공정한 비교를 위해 깊이, 너비, 하이퍼파라미터(예: 학습률, 배치 크기)를 다양하게 설정한 여러 LSTM 아키텍처를 훈련시켰다.
  • 훈련 데이터 비율(0.001에서 0.8)과 샘플 수를 다양하게 설정하여 예측 정확도 및 훈련 가능한 파라미터 수를 측정하였다.
  • HMM의 EM 수렴 문제를 완화하기 위해 AIC/BIC와 같은 모델 선택 기준 및 다수의 랜덤 초기화를 사용하였다.

실험 결과

연구 질문

  • RQ1레이블이 제한된 훈련 데이터에서 비지도 HMM이 LSTM과 유사하거나 더 높은 예측 정확도를 달성할 수 있는가?
  • RQ2HMM의 훈련 가능한 파라미터 수는 LSTM과 비교해 어떻게 되며, 이는 모델의 해석 가능성과 데이터 효율성에 어떤 영향을 미치는가?
  • RQ3상태 간 의존성이 한 단계를 초과하는 경우(예: 2차 이상 상태 의존성) HMM이 얼마나 잘 유지되는가?
  • RQ4제안된 관측값 이산화 방법이 정확도 손실 없이 연속 HMM을 이산 HMM으로 전환하는 데 얼마나 효과적인가?
  • RQ5어떤 조건에서 지도 학습 HMM이 딥러닝 모델(LSTM 등)을 능가하는가?

주요 결과

  • 훈련 데이터가 제한된 경우 비지도 HMM이 LSTM을 능가한다. 케이스 IV에서 8,000개 샘플로 60.8%의 정확도를 기록했고, LSTM는 32,000개 샘플에서야 82.97%에 도달했다.
  • 지도 학습 이산 HMM(DHMM)는 케이스 IV에서 32,000개 훈련 샘플로 83.89%의 정확도를 달성하여 동일한 데이터 크기에서 모든 LSTM 변종을 능가했다.
  • 40개 샘플(0.001 비율) 조건에서도 지도 학습 DHMM은 50.91%의 정확도를 기록했고, LSTM는 35.07%로 하락하여 HMM의 뛰어난 데이터 효율성을 입증했다.
  • HMM은 LSTM보다 훨씬 적은 파라미터를 요구했다(35 대 4,484–12,804). 이는 더 높은 해석 가능성과 소규모 데이터에서의 과적합 방지에 유리하다.
  • 이산화된 HMM(DHMM)는 연속 HMM(CHMM)와 유사한 성능을 보였으며, 동일 조건에서 비지도 DHMM은 64.17%의 정확도를 기록했고(CHMM는 68.4%였음).
  • 마르코프 가정이 위반된 경우에도 HMM은 효과적이었으며, 케이스 IV에서 4,000개 샘플로 지도 학습 DHMM은 83.11%의 정확도를 기록하여 LSTM의 80.70%를 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.