[论文解读] Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition
本文提出在端到端语音识别中对RNN-Transducer(RNN-T)模型采用最小贝叶斯风险(MBR)训练,通过最小化参考转录与实时生成的N-best假设之间的期望编辑距离来优化性能。该方法显著降低了字符错误率(CER),在读写普通话语音上绝对降低1.2%,在非正式普通话语音上降低0.5%,且在结合外部神经语言模型(NNLM)时进一步提升性能。
In this work, we propose minimum Bayes risk (MBR) training of RNN-Transducer (RNN-T) for end-to-end speech recognition. Specifically, initialized with a RNN-T trained model, MBR training is conducted via minimizing the expected edit distance between the reference label sequence and on-the-fly generated N-best hypothesis. We also introduce a heuristic to incorporate an external neural network language model (NNLM) in RNN-T beam search decoding and explore MBR training with the external NNLM. Experimental results demonstrate an MBR trained model outperforms a RNN-T trained model substantially and further improvements can be achieved if trained with an external NNLM. Our best MBR trained system achieves absolute character error rate (CER) reductions of 1.2% and 0.5% on read and spontaneous Mandarin speech respectively over a strong convolution and transformer based RNN-T baseline trained on ~21,000 hours of speech.
研究动机与目标
- 开发一种针对RNN-T的判别性训练方法,通过最小化期望编辑距离直接优化转录质量。
- 解决尽管在其他ASR框架中已取得成功,但RNN-T系统中仍缺乏MBR训练的问题。
- 探索在束搜索解码和MBR训练中集成外部神经语言模型(NNLM)的方法,以提升鲁棒性与准确性。
- 证明基于N-best假设生成的MBR训练在大规模普通话语音数据集上优于标准RNN-T训练。
提出的方法
- 使用预训练的RNN-T模型初始化MBR训练,以确保优化过程稳定。
- 在训练过程中使用束搜索(束大小为8)生成N-best假设,并从模型输出分布中采样。
- 将参考转录与N-best假设之间的期望编辑距离计算为MBR目标函数。
- 采用正则化损失函数,结合MBR损失与标准RNN-T损失(λ = 1.0),以维持训练稳定性并防止N-best生成过程显著变慢。
- 引入启发式方法,在束搜索解码中通过对数概率插值整合外部NNLM,使用固定插值权重λ = 0.1。
- 联合训练MBR模型,是否包含外部NNLM均可,实现声学与语言建模组件的端到端联合优化。
实验结果
研究问题
- RQ1MBR训练能否有效应用于RNN-T模型,以提升自动语音识别性能?
- RQ2在束搜索解码过程中引入外部神经语言模型(NNLM)是否能增强MBR训练效果?
- RQ3与外部NNLM联合训练对MBR优化的RNN-T模型在字符错误率(CER)降低方面有何影响?
- RQ4在读写与非正式语音上,MBR训练与标准RNN-T训练在收敛性和鲁棒性方面有何对比?
主要发现
- 与强基线(基于卷积和Transformer的RNN-T)相比,MBR训练的RNN-T模型在读写普通话语音集上CER绝对降低1.2%,在非正式语音集上降低0.5%。
- 即使不使用外部NNLM,MBR训练模型的性能也优于在解码阶段使用外部NNLM的标准RNN-T基线模型。
- 当外部NNLM同时用于训练和解码时,MBR模型达到最佳性能,在读写语音集上CER降低5.0%,在非正式语音集上降低14.9%。
- 在解码过程中使用β = 0.8的Softmax平滑处理,可使读写语音集的CER从6.5%降至6.2%,非正式语音集从15.6%降至15.4%。
- 通过浅层融合方式引入外部NNLM,可使基线RNN-T模型的CER在读写语音集上降低0.5%,在非正式语音集上降低0.1%。
- 通过标准RNN-T损失对MBR损失进行正则化(λ = 1.0)可有效防止N-best生成过程显著变慢,同时保持训练效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。