Skip to main content
QUICK REVIEW

[论文解读] Internal Language Model Estimation based Language Model Fusion for Cross-Domain Code-Switching Speech Recognition

Yizhou Peng, Yufei Liu|arXiv (Cornell University)|Jul 9, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本文提出了一种基于内部语言模型估计(ILME)的语言模型融合方法,用于跨领域语码转换语音识别(CSSR),利用单语数据训练多语言端到端自动语音识别(ASR)模型。该方法通过从Transformer解码器估计内部语言模型,并将其与外部语言模型融合,显著提升了识别性能——相对错误率最高降低32.1%,在同域和跨域设置下均优于传统的浅层融合方法。

ABSTRACT

Internal Language Model Estimation (ILME) based language model (LM) fusion has been shown significantly improved recognition results over conventional shallow fusion in both intra-domain and cross-domain speech recognition tasks. In this paper, we attempt to apply our ILME method to cross-domain code-switching speech recognition (CSSR) work. Specifically, our curiosity comes from several aspects. First, we are curious about how effective the ILME-based LM fusion is for both intra-domain and cross-domain CSSR tasks. We verify this with or without merging two code-switching domains. More importantly, we train an end-to-end (E2E) speech recognition model by means of merging two monolingual data sets and observe the efficacy of the proposed ILME-based LM fusion for CSSR. Experimental results on SEAME that is from Southeast Asian and another Chinese Mainland CS data set demonstrate the effectiveness of the proposed ILME-based LM fusion method.

研究动机与目标

  • 评估基于ILME的语言模型融合在同域和跨域语码转换语音识别任务中的有效性。
  • 探究是否能够有效利用单语数据训练多语言ASR模型以实现语码转换识别。
  • 证明基于ILME的融合方法在跨域CSSR中优于传统浅层融合,尤其是在训练数据有限的情况下。
  • 探讨联合CTC-注意力训练在使多语言ASR模型泛化到语码转换语音方面的作用。

提出的方法

  • 该方法采用基于Conformer的端到端ASR模型,并结合CTC-注意力联合训练,以处理语码转换语音。
  • 利用在单语文本数据上训练的Transformer解码器估计内部语言模型(ILM),以捕捉语言特异性统计特征。
  • 基于ILME的语言模型融合通过加权求和的方式,将ASR模型的输出概率与估计的ILM概率相结合:argmax_Y (log P(Y|X) + λ log P_ILM(Y))。
  • 该方法同时应用浅层融合(SF)和LSCL-based融合(LSCL)以进行性能比较,结果显示LSCL表现更优。
  • 将SEAME和ASRU语料库中的单语数据合并,用于训练多语言ASR模型,从而实现零样本跨领域泛化。
  • 该方法在CS识别模型和单语训练模型上均进行了评估,证明其在不同数据配置下均具有鲁棒性。

实验结果

研究问题

  • RQ1基于ILME的语言模型融合能否提升跨领域语码转换语音识别的性能?
  • RQ2当训练数据有限或仅包含单语数据时,基于ILME的融合方法效果如何?
  • RQ3联合CTC-注意力训练是否能使多语言ASR模型在无显式语码转换数据的情况下泛化到语码转换语音?
  • RQ4在同域和跨域CSSR任务中,基于ILME的融合与传统浅层融合相比表现如何?
  • RQ5单语数据能否被有效用于训练可泛化到语码转换场景的多语言ASR模型?

主要发现

  • 当仅使用单语数据进行训练时,基于ILME的语言模型融合方法在ASRU测试集上相较于浅层融合实现了最高32.1%的相对错误率降低。
  • 在SEAME语料库上,该方法在同域测试中将词错误率降低了1.4个百分点(从15.7%降至15.4%),且在跨域设置中也表现出一致的性能提升。
  • LSCL-based融合变体在所有测试集上均优于浅层融合,在ASRU dev2集上实现了3.3%的绝对错误率降低(从49.7%降至46.5%)。
  • 在合并的单语数据上训练的多语言ASR模型取得了最佳基线性能,SEAME测试集上的错误率为63.9%,并进一步通过ILME融合得到提升。
  • CTC-only模型在单语和语码转换数据上均表现出稳定的收敛性,而注意力-only模型在验证数据上出现发散,表明注意力机制在泛化到未见语码转换模式方面存在困难。
  • 结果证实,即使训练数据未标注语码转换,基于ILME的融合方法依然有效,使其适用于低资源语码转换场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。