Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Factorial Hidden Markov Models: Stochastic Variational Inference without Messages

Yin Cheng Ng, Pawel M. Chilinski|arXiv (Cornell University)|2016. 08. 12.
Bayesian Methods and Mixture Models참고 문헌 21인용 수 6
한 줄 요약

이 논문은 공유된 순방향 신경망을 사용하여 이元적 가우시안 코풀라 체인을 매개변수화함으로써 메시지 전달을 제거하는 확장 가능한 스 tochastic 변분 추론 알고리즘을 제안한다. 이 방법은 장기간의 시계열 데이터에 대해 분산형 스 tochastic 최적화를 가능하게 하여 정확도 향상을 이룬다. 이는 추가적인 근사 편향 없이 대규모 데이터에서 구조적 평균장 방법보다 뛰어난 성능을 달성한다.

ABSTRACT

Factorial Hidden Markov Models (FHMMs) are powerful models for sequential data but they do not scale well with long sequences. We propose a scalable inference and learning algorithm for FHMMs that draws on ideas from the stochastic variational inference, neural network and copula literatures. Unlike existing approaches, the proposed algorithm requires no message passing procedure among latent variables and can be distributed to a network of computers to speed up learning. Our experiments corroborate that the proposed algorithm does not introduce further approximation bias compared to the proven structured mean-field algorithm, and achieves better performance with long sequences and large FHMMs.

연구 동기 및 목표

  • 긴 시계열과 큰 상태 공간을 가진 FHMM에서 정확한 추론의 계산 비용 문제를 해결하기 위해.
  • FHMM의 변분 추론에서 메시지 전달이 필요 없도록 하여 분산 계산을 가능하게 하기 위해.
  • 코풀라 매개변수를 공유된 인식 신경망으로 재매개변수화하여 변분 추론을 장기간의 시계열에까지 확장하기 위해.
  • 추가적인 근사 편향 없이 구조적 평균장 방법과 유사한 근사 정확도를 유지하면서 대규모 데이터셋에서 스 tochastic 최적화를 가능하게 하기 위해.
  • 기존 방법이 계산 제약으로 인해 실패하는 장기간의 시계열과 큰 모델에서 뛰어난 성능을 보여주기 위해.

제안 방법

  • 이 방법은 전통적인 메시지 전달 방식을 대체하기 위해 잠재 변수 간의 의존성을 이원적 가우시안 코풀라로 모델링한다.
  • 시간 포인트 간의 코풀라 체인 매개변수를 매개변수화하기 위해 공유된 순방향 신경망(인식 네트워크)을 도입하여 효율적이고 확장 가능한 추론을 가능하게 한다.
  • 작은 배치로 무작위로 샘플링된 부분체인을 사용하여 로그-주변 가능도의 스 tochastic 하한을 최적화하기 위해 확률적 경량 하강법을 사용한다.
  • 인식 네트워크는 공분산, 발화 가중치, 전이 행렬과 함께 엔드 투 엔드 최적화를 통해 함께 훈련된다.
  • 잠재 변수 간의 명시적 메시지 전달을 피하여 여러 컴퓨팅 노드 간의 병렬 처리가 가능해진다.
  • 재매개변수화의 사용으로 스 tochastic 부분체인을 통해 역전파가 가능해져, 딥러닝 최적화 기법에 적합한 방법이 된다.

실험 결과

연구 질문

  • RQ1메시지 전달에 의존하지 않고도 긴 시계열에 대해 FHMM 추론을 확장할 수 있는가?
  • RQ2신경망과 부분체인 샘플링을 사용한 스 tochastic 변분 추론 방법이 구조적 평균장 방법과 비교해 근사 정확도를 유지할 수 있는가?
  • RQ3제한된 계산 자원에서 장기간의 시계열에서 제안된 방법이 구조적 평균장 방법보다 모델 가능도와 예측 성능 측면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ4공유된 인식 네트워크를 사용해 무한 길이의 확률적 과정에서의 추론을 분리할 수 있는가?
  • RQ5이 방법은 대규모 순차적 데이터를 효과적으로 활용하여 모델 성능을 향상시킬 수 있는가?

주요 결과

  • 모의 실험 및 Bach chorales 데이터에서 짧은 시계열에서는 제안된 알고리즘이 구조적 평균장 방법과 유사한 로그가능도 값을 기록하여 경쟁적인 성능을 달성한다.
  • 긴 시계열에서는 고정된 계산 자원 조건에서 제안된 방법이 구조적 평균장 방법을 크게 능가하며, 길이 150,000의 시계열에서는 후자가 단일 반복조차 완료하지 못했다.
  • 100만 개의 시간 단위를 가진 가정 전력 소비 데이터셋에서 제안된 방법은 테스트 MSE(평균 0.106)를 기록하여 SMF-EM(평균 0.194)보다 더 낮은 오차를 기록하여 더 뛰어난 예측 정확도를 보였다.
  • 6차원 전력 소비 데이터의 일부 차원에서는 제안된 방법이 SMF-EM 대비 MSE를 최대 65%까지 감소시켜 대규모 데이터에서 더 나은 모델 적합도를 보였다.
  • 이 알고리즘은 10개의 체인을 가진 FHMM을 100만 단계의 시계열에서 성공적으로 학습했으며, 이는 SMF-EM이 계산 제약으로 인해 수행이 불가능한 작업이었다.
  • 공유된 인식 네트워크의 사용으로 메모리 및 계산 비용이 감소하여 마르코프 체인 수가 증가함에 따라 확장성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.