Skip to main content
QUICK REVIEW

[論文レビュー] Normalizing Flow based Hidden Markov Models for Classification of Speech Phones with Explainability

Anubhab Ghosh, Antoine Honoré|arXiv (Cornell University)|Jul 1, 2021
Speech Recognition and Synthesis参考文献 35被引用数 4
ひとこと要約

本稿では、説明可能な尤度計算を備えた生成的モデリングを用いて音声電話分類を実行する、正規化フローを用いた隠れマルコフモデル(NMM-HMM)を提案する。従来のガウス・ミックスチャネル・モデル(GMM)を、RealNVPおよびGlowを用いた正規化フローに置き換えることで、EMとミニバッチ勾配降下法を組み合わせた訓練手法を採用し、MFCCのみと生成的訓練を用いてTIMITデータセットで86.6%の精度を達成した。これは、判別的学習や特徴工学を用いずに、最先端の結果に匹敵する。

ABSTRACT

In pursuit of explainability, we develop generative models for sequential data. The proposed models provide state-of-the-art classification results and robust performance for speech phone classification. We combine modern neural networks (normalizing flows) and traditional generative models (hidden Markov models - HMMs). Normalizing flow-based mixture models (NMMs) are used to model the conditional probability distribution given the hidden state in the HMMs. Model parameters are learned through judicious combinations of time-tested Bayesian learning methods and contemporary neural network learning methods. We mainly combine expectation-maximization (EM) and mini-batch gradient descent. The proposed generative models can compute likelihood of a data and hence directly suitable for maximum-likelihood (ML) classification approach. Due to structural flexibility of HMMs, we can use different normalizing flow models. This leads to different types of HMMs providing diversity in data modeling capacity. The diversity provides an opportunity for easy decision fusion from different models. For a standard speech phone classification setup involving 39 phones (classes) and the TIMIT dataset, we show that the use of standard features called mel-frequency-cepstral-coeffcients (MFCCs), the proposed generative models, and the decision fusion together can achieve $86.6\%$ accuracy by generative training only. This result is close to state-of-the-art results, for examples, $86.2\%$ accuracy of PyTorch-Kaldi toolkit [1], and $85.1\%$ accuracy using light gated recurrent units [2]. We do not use any discriminative learning approach and related sophisticated features in this article.

研究の動機と目的

  • ノイズやデータ損傷に強く、性能が安定する順序付き音声データの説明可能な生成的モデルの開発。
  • 従来のGMM-HMMのモデル化能力の限界を克服するため、条件付き状態分布に現代的な正規化フローをGMMの代わりに導入すること。
  • 尤度計算可能なモデルを用いて最大尤度分類を実現するとともに、モデルベース学習による解釈可能性を維持すること。
  • 判別的ファインチューニングや複雑な特徴を用いずに、生成的モデルのみで音声電話分類において最先端の性能を達成できることを示すこと。
  • 多様なNMM-HMMバージョン(NVP-HMM、Glow-HMM)の意思決定統合を検討し、さらなる耐障害性と精度向上を図ること。

提案手法

  • HMMの条件付き状態分布をGMMから正規化フローを用いた混合モデル(NMM)に置き換え、柔軟で高容量な密度推定を可能にする。
  • NMMの基本構成として、RealNVPおよびGlow正規化フローを用い、音声特徴空間における複雑で多次元の多様体をモデル化する。
  • 混合成分の最適化に期待最大化(EM)を、フローのパラメータの最適化にミニバッチ勾配降下法を組み合わせたハイブリッド最適化戦略を採用してモデルパラメータを訓練する。
  • 正規化フローの尤度計算能力を活用し、判別的ファインチューニングを必要とせずに最大尤度分類を実現する。
  • 複数のNMM-HMMバージョン(NVP-HMM、Glow-HMM)の間で単純な投票ベースの意思決定統合を適用し、耐障害性と精度を向上させる。
  • 評価には標準的なMFCC特徴量とTIMITデータセットを用い、クリーンおよびノイズ環境(白色、ピンク色、バブリング、高周波数チャネルノイズ)下での性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1正規化フローを導入することで、尤度ベースの訓練を維持したまま、HMMのモデル化能力が音声電話分類において向上するか?
  • RQ2EMとミニバッチ勾配降下法を組み合わせたハイブリッド訓練戦略は、複雑な正規化フロー部品を備えたNMM-HMMを効果的に最適化できるか?
  • RQ3判別的学習や高度な特徴を一切用いずに、生成的モデルのみで電話認識分野で最先端の性能を達成できるか?
  • RQ4多様なNMM-HMMバージョン(例:NVP-HMMとGlow-HMM)の意思決定統合は、さまざまなノイズ条件下で耐障害性と精度をどのように向上させるか?
  • RQ5ノイズのある音声条件下において、NMM-HMMは古典的GMM-HMMに比べて、正確性と耐障害性の点でどの程度優れているか?

主な発見

  • 提案されたNMM-HMMモデルは、MFCCのみと生成的訓練を用いて、クリーンなTIMITテストセットで86.6%の電話認識精度を達成し、最先端の結果に一致する。
  • NVP-HMMはクリーンデータで76.9%の精度を、Glow-HMMは76.3%の精度を達成し、ベースラインのGMM-HMM(72.5%)を上回る。
  • GMM-HMM、NVP-HMM、Glow-HMMの投票ベース統合により86.6%の精度が得られ、モデル多様性による顕著な向上が示された。
  • ノイズ環境(例:10 dB SNR)下でも、投票ベースの統合戦略は強力な性能を維持し、hfchannelノイズ下で53.8%の精度を達成し、個々のモデルを上回った。
  • 判別的学習、高度な特徴、エンドツーエンド学習を一切用いずに、競争力のある結果を達成した。これは、説明可能な生成的モデリングの有効性を示している。
  • Glow-HMMモデルは「sil」電話クラスで99.02%の精度を達成し、低周波数で変動の大きいクラスに対する強力なモデル化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。