Skip to main content
QUICK REVIEW

[论文解读] Towards End-to-end Automatic Code-Switching Speech Recognition

Genta Indra Winata, Andrea Madotto|arXiv (Cornell University)|Oct 30, 2018
Speech Recognition and Synthesis参考文献 14被引用 12
一句话总结

本文提出一种基于CTC的端到端语音识别模型,用于句内英语-中文代码混用语音识别,通过在单语英语和中文数据集上联合训练,随后在混合语言语料库上微调。该方法利用迁移学习将字符错误率(CER)相对降低了5%,并通过n-gram语言模型重打分改进了解码效果。

ABSTRACT

Speech recognition in mixed language has difficulties to adapt end-to-end framework due to the lack of data and overlapping phone sets, for example in words such as "one" in English and "wàn" in Chinese. We propose a CTC-based end-to-end automatic speech recognition model for intra-sentential English-Mandarin code-switching. The model is trained by joint training on monolingual datasets, and fine-tuning with the mixed-language corpus. During the decoding process, we apply a beam search and combine CTC predictions and language model score. The proposed method is effective in leveraging monolingual corpus and detecting language transitions and it improves the CER by 5%.

研究动机与目标

  • 解决代码混用语音中语言转换不可预测且数据有限的自动语音识别挑战。
  • 克服传统流水线语音识别系统将声学、发音和语言建模分开处理的局限性。
  • 开发一种端到端框架,能够从单语数据中联合学习,并适应代码混用模式,而无需依赖显式的语言识别。
  • 通过利用单语语料库的迁移学习,提升在混合语言语音识别中的泛化能力和鲁棒性。
  • 证明联合训练与微调在降低代码混用识别字符错误率(CER)方面的有效性。

提出的方法

  • 在分别的单语英语和普通话中文数据集上进行联合训练,随后在代码混用语料库上进行微调,训练基于CTC的端到端语音识别模型。
  • 采用CNN-BiGRU架构,结合批量归一化和ReLU激活函数,用于特征提取和序列建模。
  • 将英语和简体中文字符集合并为单一输出词汇表,实现联合预测。
  • 使用束搜索解码,束宽为100,通过加权组合(α=0.2,β=1)结合CTC预测得分与语言模型得分。
  • 在单语数据预训练后,对代码混用数据进行微调,以适应语言转换模式。
  • 使用3-gram、4-gram和5-gram n-gram语言模型对最终假设进行重打分,以提升语法正确性并修正错误。

实验结果

研究问题

  • RQ1与仅在混合语言数据上训练相比,联合在单语数据上训练是否能提升端到端代码混用语音识别性能?
  • RQ2在没有显式语言标识的情况下,基于CTC的模型在句内代码混用中检测和转录语言转换的效率如何?
  • RQ3在联合预训练后,仅用50%的代码混用语料库进行微调,能在多大程度上降低字符错误率(CER)?
  • RQ4使用外部n-gram语言模型进行重打分,能在多大程度上提升解码准确率?
  • RQ5该模型能否在代码混用语境中正确识别跨语言发音相似的词语,如'one'与'wàn'?

主要发现

  • 在单语数据集上联合训练后,再在代码混用数据上微调,相比仅在混合语言语料库上训练,字符错误率(CER)降低了5%。
  • 该模型成功学习到语言转换的检测,并能准确转录英语和中文字符,即使在复杂的句内代码混用模式下亦然。
  • 仅使用50%的代码混用数据进行微调,即可达到与使用完整数据集相当的性能,表明具有强大的数据效率。
  • 在重打分中引入5-gram语言模型,使CER额外降低1%,有效修正了基线输出中的拼写和语法错误。
  • 该模型通过正确映射跨语言发音相似的词语(如'before'与'for'),在代码混用语境中表现出更强的泛化能力。
  • 尽管性能有所提升,该模型在保持两种语言表示的平衡性方面仍存在困难,表明未来工作需解决灾难性遗忘问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。