Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Factorial Hidden Markov Models: Stochastic Variational Inference without Messages

Yin Cheng Ng, Pawel M. Chilinski|arXiv (Cornell University)|Aug 12, 2016
Bayesian Methods and Mixture Models参考文献 21被引用数 6
ひとこと要約

本稿では、共有フィードフォワードニューラルネットワークを用いて二変量ガウシアンコプル連鎖をパrameter化することで、メッセージパッシングを排除した、因子隠れマルコフモデル(FHMM)のスケーラブルな確率的変分ベイズ推論アルゴリズムを提案する。この手法により、長時間系列における分散型確率的最適化が可能となり、追加の近似バイアスなしに大規模データで優れた性能を達成する。

ABSTRACT

Factorial Hidden Markov Models (FHMMs) are powerful models for sequential data but they do not scale well with long sequences. We propose a scalable inference and learning algorithm for FHMMs that draws on ideas from the stochastic variational inference, neural network and copula literatures. Unlike existing approaches, the proposed algorithm requires no message passing procedure among latent variables and can be distributed to a network of computers to speed up learning. Our experiments corroborate that the proposed algorithm does not introduce further approximation bias compared to the proven structured mean-field algorithm, and achieves better performance with long sequences and large FHMMs.

研究の動機と目的

  • 長時間系列および大規模な状態空間を伴うFHMMにおける正確な推論の計算的非実行可能性に対処すること。
  • FHMMの変分ベイズ推論においてメッセージパッシングの必要性を排除し、分散計算を可能にすること。
  • コプルパラメータを共有認識ニューラルネットワークで再パラメータ化することで、変分ベイズ推論を長時間系列にスケーリングすること。
  • 構造化平均場と同等の近似精度を維持しつつ、大規模データセットにおける確率的最適化を可能にすること。
  • 従来の手法が計算制限のため失敗する長時間系列および大規模モデルにおいて、優れた性能を示すこと。

提案手法

  • 本手法は、FHMMにおける潜在変数間の依存関係を二変量ガウシアンコプルでモデル化し、従来のメッセージパッシング方式を置き換える。
  • 時間点ごとに共通のフィードフォワードニューラルネットワーク(認識ネットワーク)を用いてコプル連鎖パラメータをパラメータ化することで、効率的かつスケーラブルな推論を実現する。
  • アルゴリズムは、ミニバッチでランダムに抽出された部分連鎖を用いて、対数周辺尤度の確率的下界を最適化する確率的勾配降下法を採用する。
  • 認識ネットワークは、モデルパラメータ(共分散、発生重み、遷移行列)と同時に、エンドツーエンド最適化により学習される。
  • 潜在変数間の明示的メッセージパッシングを回避することで、複数の計算ノードにおける並列処理が可能になる。
  • 再パラメータ化の使用により、確率的部分連鎖を介したバックプロパゲーションが可能となり、深層学習最適化手法に適したものとなる。

実験結果

リサーチクエスチョン

  • RQ1長時間系列において、メッセージパッシングに依存せずにFHMM推論をスケーリングすることは可能か?
  • RQ2ニューラルネットワークと部分連鎖サンプリングを用いた確率的変分ベイズ推論は、構造化平均場と比較して近似精度を維持できるか?
  • RQ3制限された計算リソースのもとで、提案手法は構造化平均場を上回るモデル尤度および予測性能を達成できるか?
  • RQ4共有認識ネットワークを用いて、無限長の確率的過程における推論を分離することは可能か?
  • RQ5本手法は大規模な時間系列データを効果的に活用してモデル性能を向上させることができるか?

主な発見

  • シミュレーションおよびBachのコーラルズデータにおいて、短時間系列では構造化平均場と同等の対数尤度値を達成し、競争力のある性能を示した。
  • 長時間系列では、固定された計算リソースのもとで、構造化平均場よりも著しく優れた性能を示した。特に、長さ150,000の系列では、後者が1回のイテレーションでさえ完了できなかった。
  • 100万ステップの家電消費電力データセットにおいて、提案手法はテストMSE(平均0.106)を達成し、SMF-EM(平均0.194)を下回った。これは、より優れた予測精度を示している。
  • 6次元の電力消費データにおいて、提案手法は一部の次元でSMF-EMと比較してMSEを最大65%まで削減し、大規模データにおけるより良いモデルフィッティングを示した。
  • 10チェーンのFHMMを100万ステップのシーケンスで成功裏に学習した。これは、計算制約のためSMF-EMでは不可能であったタスクである。
  • 共有認識ネットワークの使用により、メモリと計算コストが削減され、マルコフ連鎖の数が増加してもスケーラビリティが維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。