[论文解读] Simplified End-to-End MMI Training and Voting for ASR
本文提出了一种简化版的端到端自动语音识别(ASR)系统,采用最大互信息(MMI)训练并结合轻量级语言模型,实现类似CTC的基于梯度的直接训练。与CTC不同,该方法生成高质量对齐,支持一种简单的集成方法——对多个独立训练的模型预测结果进行平均,从而在WSJ eval92上实现23%的词错误率(WER)相对降低,在dev93上实现18.63%的WER降低,同时解码速度更快,解码图大小减少43%。
A simplified speech recognition system that uses the maximum mutual information (MMI) criterion is considered. End-to-end training using gradient descent is suggested, similarly to the training of connectionist temporal classification (CTC). We use an MMI criterion with a simple language model in the training stage, and a standard HMM decoder. Our method compares favorably to CTC in terms of performance, robustness, decoding time, disk footprint and quality of alignments. The good alignments enable the use of a straightforward ensemble method, obtained by simply averaging the predictions of several neural network models, that were trained separately end-to-end. The ensemble method yields a considerable reduction in the word error rate.
研究动机与目标
- 通过用直接的MMI准则替代复杂的混合HMM-DNN系统,简化端到端ASR训练。
- 相比CTC,提升对齐质量,这对有效模型集成至关重要。
- 通过独立训练多个模型并平均其预测结果,实现简单而高效的集成方法。
- 与CTC及混合系统相比,降低解码时间和磁盘占用。
- 在保持端到端训练和标准HMM解码的同时,实现与CTC相当的性能。
提出的方法
- 该方法使用单状态、上下文无关的音素HMM,并在词之间插入空白状态,类似于CTC。
- 在训练过程中,使用MMI准则结合简单的n-gram语言模型来构建目标函数。
- 通过梯度下降进行端到端训练,避免了HMM-GMM系统的预训练。
- 解码使用标准HMM解码器和WFST,利用模型生成的可靠对齐。
- 通过投票机制,对多个独立训练的DNN的输出后验概率进行平均,形成集成结果。
- 将语言模型整合到MMI目标函数中,引导网络生成更准确的转录。
实验结果
研究问题
- RQ1简化版端到端MMI训练方法是否能在保持训练简便性的同时,实现优于CTC的性能?
- RQ2所提方法是否生成比CTC更可靠的对齐,从而支持有效的模型平均?
- RQ3基于后验概率平均的简单投票方案是否优于需要完整解码过程的复杂CTC集成方法?
- RQ4与CTC和混合系统相比,该方法在多大程度上减少了解码时间和磁盘占用?
- RQ5在MMI目标函数中集成轻量级语言模型对识别准确率有何影响?
主要发现
- 所提出的EEMMI方法在WSJ eval92集上相比单模型实现23%的词错误率(WER)相对降低,WER降至4.22%。
- 在dev93集上,集成方法将WER降低了18.63%,达到7.34%的WER。
- 与CTC相比,该方法将解码图大小减少了43%,显著降低了磁盘占用。
- 解码速度比CTC快1.38倍,实时因子为0.0179,而CTC为0.0247。
- 模型生成的对齐质量显著优于CTC,表现为集成中后验概率方差降低,支持有效平均。
- 简单的投票方案优于需要每模型完整解码的复杂CTC集成方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。