Skip to main content
QUICK REVIEW

[论文解读] On the End-to-End Solution to Mandarin-English Code-switching Speech Recognition

Zhiping Zeng, Yerbolat Khassanov|arXiv (Cornell University)|Nov 1, 2018
Speech Recognition and Synthesis参考文献 25被引用 13
一句话总结

本文提出了一种用于普通话-英语代码切换的端到端(E2E)语音识别系统,结合数据增强、字节对编码(BPE)子词单元、语言识别(LID)的多任务学习,以及神经语言模型(NLM)词汇扩展方法。该方法在开发集上将词错误率(WER)降低了9.5个百分点,在SEAME语料库上实现了接近最先进水平的性能。

ABSTRACT

Code-switching (CS) refers to a linguistic phenomenon where a speaker uses different languages in an utterance or between alternating utterances. In this work, we study end-to-end (E2E) approaches to the Mandarin-English code-switching speech recognition (CSSR) task. We first examine the effectiveness of using data augmentation and byte-pair encoding (BPE) subword units. More importantly, we propose a multitask learning recipe, where a language identification task is explicitly learned in addition to the E2E speech recognition task. Furthermore, we introduce an efficient word vocabulary expansion method for language modeling to alleviate data sparsity issues under the code-switching scenario. Experimental results on the SEAME data, a Mandarin-English CS corpus, demonstrate the effectiveness of the proposed methods.

研究动机与目标

  • 开发一种具有竞争力的端到端(E2E)语音识别系统,用于普通话-英语代码切换,避免传统DNN-HMM框架的局限性。
  • 通过改进子词单元表示和语言建模,解决代码切换中的数据稀疏性和语言不平衡问题。
  • 通过将语言识别(LID)作为辅助任务的多任务学习,提升E2E模型的性能。
  • 通过一种新颖的神经语言模型(NLM)词汇扩展方法,缓解语言模型中的跨语言数据稀疏性问题。

提出的方法

  • 采用语音速度扰动进行数据增强,将训练数据扩大3倍(90%、100%、110%速度变体)。
  • 使用3000个子词单元的字节对编码(BPE),在普通话和英语之间实现更好的表示平衡,优于字符级单元。
  • 通过联合训练E2E自动语音识别(ASR)模型与语言识别(LID)头,引入多任务学习,采用带有超参数λ₂的加权损失函数。
  • 采用两种LID训练变体:共享头和独立头,均集成到E2E训练过程中。
  • 提出一种神经语言模型(NLM)词汇扩展技术,以增强n-gram重排序,提升对罕见代码切换词组合的覆盖能力。
  • 通过扩展后的NLM执行N-best重排序,以优化ASR假设,降低最终输出的错误率。

实验结果

研究问题

  • RQ1端到端语音识别模型是否能在不依赖词典或语言特定建模的情况下,有效处理普通话-英语代码切换?
  • RQ2数据增强和子词单元选择(BPE与字符)对E2E代码切换ASR性能有何影响?
  • RQ3与语言识别(LID)联合训练的多任务学习在多大程度上提升了E2E代码切换ASR的鲁棒性和准确性?
  • RQ4针对神经语言模型(NLM)的词汇扩展方法是否能有效缓解跨语言代码切换场景下的数据稀疏性问题?
  • RQ5所有所提技术的综合效应在多大程度上降低了代码切换语音识别中的词错误率(WER)?

主要发现

  • 数据增强显著提升了E2E ASR性能,使用BPE子词单元(3000个单元)的效果优于字符级输出。
  • 基于LID的多任务学习方法在开发集man上将词错误率(TER)降低最多0.9个百分点,在开发集sge上降低1.0个百分点,最优λ₂ ≈ 0.2。
  • 所提出的NLM词汇扩展方法在开发集man上将TER从35.8%降至25.0%,在开发集sge上从46.5%降至34.5%,实现了接近最先进水平的性能。
  • 跨语言替换相对较少(约占总错误的10%),其中更多英语词被替换为普通话字符(S_E→M ≈ 8%),反之则较少(S_M→E ≈ 3%)。
  • 性能最佳的系统(E2E-DA-BPE3k + LID_indep + NLM扩展)在开发集man上TER为25.0%,在开发集sge上为34.5%,分别比基线E2E-DA-CHAR系统降低9.5和12.0个百分点。
  • 该方法在基于字符的系统上效果最显著,表明LID有助于缓解字符级建模带来的不平衡问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。