Skip to main content
QUICK REVIEW

[论文解读] On Language Model Integration for RNN Transducer based Speech Recognition

Wei Zhou, Zuoyun Zheng|arXiv (Cornell University)|Oct 13, 2021
Speech Recognition and Synthesis被引用 4
一句话总结

该论文提出了一种基于RNN-Transducer的语音识别新型精确-ILM训练框架,通过纠正模型内部语言模型(ILM)与外部语言模型(LM)之间的不匹配,改进了语言模型集成。通过扩展HAT证明并将在统一的RNN-T框架内形式化ILM校正,该方法在域内(Librispeech)和跨域(TED-LIUM)基准上均实现了最先进(SOTA)的词错误率(WER)改进,最佳性能通过结合基于mini-LSTM的ILM方法与精确-ILM训练实现。

ABSTRACT

The mismatch between an external language model (LM) and the implicitly learned internal LM (ILM) of RNN-Transducer (RNN-T) can limit the performance of LM integration such as simple shallow fusion. A Bayesian interpretation suggests to remove this sequence prior as ILM correction. In this work, we study various ILM correction-based LM integration methods formulated in a common RNN-T framework. We provide a decoding interpretation on two major reasons for performance improvement with ILM correction, which is further experimentally verified with detailed analysis. We also propose an exact-ILM training framework by extending the proof given in the hybrid autoregressive transducer, which enables a theoretical justification for other ILM approaches. Systematic comparison is conducted for both in-domain and cross-domain evaluation on the Librispeech and TED-LIUM Release 2 corpora, respectively. Our proposed exact-ILM training can further improve the best ILM method.

研究动机与目标

  • 解决由于模型内部语言模型(ILM)与外部语言模型(LM)之间不匹配,导致基于RNN-Transducer的语音识别性能受限的问题。
  • 为在RNN-T架构内比较各种基于ILM校正的语言模型集成方法,提供一个统一框架。
  • 通过将HAT证明扩展至推导精确-ILM训练目标,从理论上证明ILM校正方法的合理性。
  • 在域内(Librispeech)和跨域(TED-LIUM Release 2)语音识别任务上,系统性地评估所提出的方法。

提出的方法

  • 通过扩展混合自回归转换器(HAT)框架的理论证明,提出一种新的精确-ILM训练目标,记为 $\mathcal{L}^{\text{exact}}_{\text{ILM}}$。
  • 引入一个统一的RNN-T框架,使多种ILM校正方法(包括密度比、HAT风格和mini-LSTM方法)得以形式化和比较。
  • 应用贝叶斯解码解释,阐明ILM校正的两个关键优势:重新平衡标签概率分布和提升标签似然度。
  • 采用改进的解码策略,结合重归一化和长度奖励,以隔离并验证ILM校正各组件的独立影响。
  • 使用包含编码器、预测网络和联合网络的RNN-T架构,其中ILM从模型内部动态中估计,且不包含编码器的影响。
  • 应用对数线性组合(浅融合)结合外部LM得分,但通过估计的ILM校正RNN-T后验概率,以减少不匹配。

实验结果

研究问题

  • RQ1从解码角度,ILM校正如何提升基于RNN-Transducer的语音识别性能?
  • RQ2ILM校正通过哪两种主要机制提升识别准确率?这些机制如何在实验中被隔离和验证?
  • RQ3ILM校正的理论依据能否超越近似方法,扩展为精确的训练目标?
  • RQ4所提出的精确-ILM训练框架在域内和跨域语音识别任务上的性能,相较于现有ILM校正方法如何?
  • RQ5通过 $\mathcal{L}_{\text{ILMT}}$ 联合训练ILM是否能在不同ILM校正方法中提升性能?

主要发现

  • 所提出的精确-ILM训练框架 ($\mathcal{L}^{\text{exact}}_{\text{ILM}}$) 在所有评估设置中均取得最佳性能,在Librispeech和TED-LIUM Release 2数据集上均优于所有其他ILM校正方法。
  • 原用于注意力模型的 $h'_{\text{mini-LSTM}}$ ILM方法在应用于RNN-T时表现最佳,尤其在结合精确-ILM训练时。
  • 在域内Librispeech dev-other集上,结合精确-ILM训练的 $h'_{\text{mini-LSTM}}$ 方法将WER降低至4.4%,显著优于基线浅融合(SF,5.1%)及其他ILM方法。
  • 在跨域TED-LIUM Release 2集上,该方法将WER降低至10.5%,展现出对领域偏移的鲁棒性。
  • 分析性消融研究证实,ILM校正提供两种独立但互补且协同增效的优势:重新平衡标签概率分布和提升标签似然度。
  • $\mathcal{L}_{\text{ILMT}}$ 训练目标在跨域TLv2任务上提升了性能,但在域内Librispeech任务上未见增益,与HAT中的先前观察一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。