[论文解读] Towards Consistent Hybrid HMM Acoustic Modeling
本文提出一种无需聚类或先前GMM对齐的平启动因子化混合HMM模型,通过端到端的帧级交叉熵损失与Viterbi训练,利用简单模型的对齐结果进行训练,从而简化了训练流程。该方法在Switchboard数据集上达到与标准混合系统相当的性能——相对WER仅差2.8%,表明状态绑定和复杂聚类并非实现高性能的必要条件。
High-performance hybrid automatic speech recognition (ASR) systems are often trained with clustered triphone outputs, and thus require a complex training pipeline to generate the clustering. The same complex pipeline is often utilized in order to generate an alignment for use in frame-wise cross-entropy training. In this work, we propose a flat-start factored hybrid model trained by modeling the full set of triphone states explicitly without relying on clustering methods. This greatly simplifies the training of new models. Furthermore, we study the effect of different alignments used for Viterbi training. Our proposed models achieve competitive performance on the Switchboard task compared to systems using clustered triphones and other flat-start models in the literature.
研究动机与目标
- 消除混合HMM声学建模中对复杂聚类流程的依赖。
- 通过避免基于GMM的对齐和状态绑定,简化训练过程。
- 评估不同对齐方式对平启动因子化混合框架中Viterbi训练的影响。
- 比较在上下文相关、未聚类三音素模型中,全和训练与Viterbi训练的性能表现。
- 评估从初始重对齐模型开始的平启动训练是否能与标准混合系统性能相当。
提出的方法
- 提出一种因子化混合HMM模型,显式建模所有三音素状态,无需聚类或状态绑定。
- 采用全和训练目标,并引入简化假设以避免完整三音素依赖建模。
- 使用帧级交叉熵损失结合Viterbi解码实现端到端优化。
- 利用单音素、双音素和Tandem系统生成的对齐结果作为多阶段语音训练的初始化。
- 为每个因子分别应用先验,以防止对齐中沉默状态占主导。
- 通过使用(n-1)-音素模型初始化n-音素模型并重置优化器,实现多阶段语音训练。
实验结果
研究问题
- RQ1平启动因子化混合HMM模型是否能在无需聚类或基于GMM对齐的情况下实现具有竞争力的性能?
- RQ2初始对齐方式的选择如何影响因子化混合模型中Viterbi训练的性能?
- RQ3使用逐步更复杂的对齐方式实现多阶段语音训练,能带来多大的性能增益?
- RQ4在未聚类三音素模型中,全和训练与Viterbi训练在WER上的表现如何比较?
- RQ5从零开始训练的因子化混合模型是否能与采用状态绑定的标准混合系统性能相当?
主要发现
- 该平启动因子化混合模型在Switchboard数据集上达到15.0%的WER,仅比采用Viterbi训练的标准混合系统高7.3%相对WER。
- 使用基于Tandem的对齐进行Viterbi训练时,因子化三音素模型相比标准混合系统实现2.8%相对WER的性能提升。
- 采用重对齐初始模型的多阶段语音训练带来稳定性能提升,双音素对齐使单音素模型的WER相对降低9.9%。
- 使用GMM-单音素对齐和F-align训练的模型相比标准混合系统有6.0%相对WER的下降,而使用双音素对齐后降至2.1%。
- 在结合F-align时,采用简化假设的全和训练相比Viterbi训练略优,但差距较小。
- 使用Viterbi训练和Tandem对齐的因子化混合模型相比使用相同对齐的标准混合系统,相对WER提升2.8%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。