Skip to main content
QUICK REVIEW

[論文レビュー] Powering Hidden Markov Model by Neural Network based Generative Models

Dong Liu, Antoine Honoré|arXiv (Cornell University)|Oct 13, 2019
Speech Recognition and Synthesis参考文献 24被引用数 10
ひとこと要約

本稿では、各隠れ状態が流れベースの生成モデルの混合により、正確かつ効率的な尤度計算を可能にする、ニューラルネットワークベースの生成モデルで強化された新しい隠れマルコフモデル(GenHMM)を提案する。このモデルは、音声分類タスクにおいてGMM-HMMを上回る性能を発揮し、クリアな状態およびノイズ混在状態の両方で、発音認識タスクにおいて最大13.2%の精度向上を達成した。これは、EMフレームワーク内に統合された深層生成コンponentsによって、モデルの表現能力と耐障害性が向上したことを示している。

ABSTRACT

Hidden Markov model (HMM) has been successfully used for sequential data modeling problems. In this work, we propose to power the modeling capacity of HMM by bringing in neural network based generative models. The proposed model is termed as GenHMM. In the proposed GenHMM, each HMM hidden state is associated with a neural network based generative model that has tractability of exact likelihood and provides efficient likelihood computation. A generative model in GenHMM consists of mixture of generators that are realized by flow models. A learning algorithm for GenHMM is proposed in expectation-maximization framework. The convergence of the learning GenHMM is analyzed. We demonstrate the efficiency of GenHMM by classification tasks on practical sequential data. Code available at https://github.com/FirstHandScientist/genhmm.

研究の動機と目的

  • 従来のGMM-HMMが非線形的で複雑な逐次データ分布をモデル化する能力に限界を示す問題に対処すること。
  • ニューラルネットワークベースの生成モデルを用いて、高い表現能力を持つ生成HMMフレームワークを開発すること。
  • 流れベースの正規化フローを用いることで、HMMにおける正確かつ効率的な尤度計算を可能にすること。
  • EMのシンプルさを保ちつつ、柔軟で高容量の生成コンponentsをサポートする、提案モデルのトレーニングアルゴリズムを提供すること。
  • 実世界の逐次データにおける分類タスクにおいて、モデルの優位性を実証的に検証すること、特にノイズ混在条件下での性能を重視すること。

提案手法

  • GenHMMは、各HMM状態における標準的なGMM発生モデルを、流れベースの生成モデルの混合に置き換え、変数変換の公式を用いて正確な尤度計算を可能にする。
  • 混合モデル内の各生成器は正規化フローとして実装され、可逆的で微分可能な変換を提供し、取り扱いやすい密度推定を可能にする。
  • モデルは期待値最大化(EM)フレームワークを用いてトレーニングされ、Mステップでは勾配降下法を用いてフローのパラメータを最適化する。
  • EMアルゴリズムは弱い正則性条件のもとで収束を保証し、GMM-HMMと同様に安定したトレーニングを可能にする。
  • 各状態の発生確率はフローの混合としてモデル化され、複雑で非線形なデータ多様体を捉えることができる。
  • フレームワークは生成的および判別的評価を両立でき、MFCC特徴量を用いたTIMIT発音認識データセットを用いた実験が実施された。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークベースの生成モデルは、逐次データのHMMのモデリング能力を向上させることができるか?
  • RQ2正規化フローを発生モデルとして用いることで、HMMにおける正確な尤度計算を効率的に達成できるか?
  • RQ3提案されたGenHMMは、実世界の逐次データにおいて、標準的なGMM-HMMを上回る分類精度を達成するか?
  • RQ4音声認識タスクにおいて、GenHMMはGMM-HMMと比較して入力ノイズに対してより耐性があるか?
  • RQ5階層的またはエンドツーエンドのチューニングを必要とせずに、EMベースのトレーニングフレームワークを深層生成HMMに効果的に適用できるか?

主な発見

  • クリアなTIMITデータ(39発音)において、GenHMMは77.7%のテスト精度を達成し、同じ条件下でGMM-HMMの68.0%を顕著に上回った。
  • 30dBの白色ノイズが混在するテストデータでは、GenHMMは74.3%の精度を維持した一方、GMM-HMMは57.1%に低下し、より優れた耐障害性を示した。
  • 20dBのピンクノイズ下でも、GenHMMは65.1%の精度を達成したのに対し、GMM-HMMは48.8%に低下し、ノイズタイプにかかわらず一貫した向上が確認された。
  • 61発音設定(K=5)では、GenHMMは52.3%の精度(GMM-HMMは42.2%)を達成し、スケーラビリティと一般化能力の優位性を示した。
  • 最も厳しいノイズ条件(30dB白色ノイズ)において、GenHMMはGMM-HMMを13.2%の絶対的精度向上で上回り、その耐性の高さを裏付けた。
  • すべてのノイズタイプおよびSNRレベルにおいて、GenHMMはGMM-HMMよりも高い適合率とF1スコアを維持し、一貫した性能向上を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。