Skip to main content
QUICK REVIEW

[论文解读] Normalizing Flow based Hidden Markov Models for Classification of Speech Phones with Explainability

Anubhab Ghosh, Antoine Honoré|arXiv (Cornell University)|Jul 1, 2021
Speech Recognition and Synthesis参考文献 35被引用 4
一句话总结

该论文提出基于归一化流的隐马尔可夫模型(NMM-HMM)用于语音音素分类,采用生成建模方法并实现可解释的似然计算。通过用归一化流(RealNVP 和 Glow)替代 HMM 中传统的高斯混合模型(GMM),并结合期望最大化(EM)与小批量梯度下降进行训练,该方法仅使用 MFCC 特征和生成式训练即在 TIMIT 数据集上达到 86.6% 的准确率,与当前最先进结果相当,且无需判别性微调或人工设计特征。

ABSTRACT

In pursuit of explainability, we develop generative models for sequential data. The proposed models provide state-of-the-art classification results and robust performance for speech phone classification. We combine modern neural networks (normalizing flows) and traditional generative models (hidden Markov models - HMMs). Normalizing flow-based mixture models (NMMs) are used to model the conditional probability distribution given the hidden state in the HMMs. Model parameters are learned through judicious combinations of time-tested Bayesian learning methods and contemporary neural network learning methods. We mainly combine expectation-maximization (EM) and mini-batch gradient descent. The proposed generative models can compute likelihood of a data and hence directly suitable for maximum-likelihood (ML) classification approach. Due to structural flexibility of HMMs, we can use different normalizing flow models. This leads to different types of HMMs providing diversity in data modeling capacity. The diversity provides an opportunity for easy decision fusion from different models. For a standard speech phone classification setup involving 39 phones (classes) and the TIMIT dataset, we show that the use of standard features called mel-frequency-cepstral-coeffcients (MFCCs), the proposed generative models, and the decision fusion together can achieve $86.6\%$ accuracy by generative training only. This result is close to state-of-the-art results, for examples, $86.2\%$ accuracy of PyTorch-Kaldi toolkit [1], and $85.1\%$ accuracy using light gated recurrent units [2]. We do not use any discriminative learning approach and related sophisticated features in this article.

研究动机与目标

  • 开发适用于序列语音数据的可解释生成模型,使其在噪声和数据损坏条件下仍保持稳健性能。
  • 通过用现代归一化流替代传统 GMM-HMM 中的 GMM,克服其建模能力有限的问题,以建模条件状态分布。
  • 在保留基于模型学习可解释性的同时,实现基于可计算似然的极大似然分类。
  • 证明仅使用生成模型即可在语音音素分类任务中达到最先进性能,而无需判别性微调或复杂特征。
  • 探索多种 NMM-HMM 变体(NVP-HMM、Glow-HMM)的决策融合,以进一步提升鲁棒性与准确率。

提出的方法

  • 将 HMM 中的条件状态分布从 GMM 替换为基于归一化流的混合模型(NMM),以实现灵活且高容量的概率密度估计。
  • 使用 RealNVP 和 Glow 归一化流作为 NMM 中的基础组件,以建模语音特征空间中复杂且多模态的数据流形。
  • 通过混合优化策略训练模型参数:使用期望最大化(EM)优化混合组件,使用小批量梯度下降优化流参数。
  • 利用归一化流的似然计算能力,支持无需判别性微调的最大似然分类。
  • 对多个 NMM-HMM 变体(NVP-HMM、Glow-HMM)采用简单的投票式决策融合策略,以增强鲁棒性与准确率。
  • 使用标准 MFCC 特征和 TIMIT 数据集,在干净与噪声条件(白噪声、粉红噪声、 babble 噪声、高频信道噪声)下进行评估。

实验结果

研究问题

  • RQ1归一化流是否能在保持基于似然的训练方式的同时,提升 HMM 在语音音素分类任务中的建模能力?
  • RQ2结合 EM 与小批量梯度下降的混合训练策略,是否能有效优化包含复杂归一化流组件的 NMM-HMM?
  • RQ3仅使用生成模型是否可实现无需判别性学习或高级特征的语音音素识别最先进性能?
  • RQ4对多种 NMM-HMM 变体(如 NVP-HMM 与 Glow-HMM)进行决策融合,是否能在不同噪声条件下提升鲁棒性与准确率?
  • RQ5在噪声语音条件下,NMM-HMM 相较于经典 GMM-HMM 在准确率与鲁棒性方面提升程度如何?

主要发现

  • 所提出的 NMM-HMM 模型仅使用 MFCC 特征和生成式训练,即在干净 TIMIT 测试集上实现 86.6% 的音素识别准确率,与最先进结果相当。
  • NVP-HMM 变体在干净数据上达到 76.9% 准确率,Glow-HMM 变体达到 76.3% 准确率,均优于基线 GMM-HMM 的 72.5%。
  • 通过融合 GMM-HMM、NVP-HMM 和 Glow-HMM 的投票策略,实现 86.6% 准确率,表明模型多样性可显著提升性能。
  • 在噪声条件下(如 10 dB SNR),基于投票的融合策略保持强性能,例如在 hfchannel 噪声下达到 53.8% 准确率,优于单一模型。
  • 该方法在未使用判别性学习、复杂特征或端到端训练的情况下取得具有竞争力的结果,凸显了可解释生成建模的可行性。
  • Glow-HMM 模型在 'sil' 音素类别上达到 99.02% 准确率,表明其对低频、高变异性类别的建模能力极强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。