Skip to main content
QUICK REVIEW

[论文解读] Cross-Language Transfer Learning, Continuous Learning, and Domain Adaptation for End-to-End Automatic Speech Recognition

Jocelyn Huang, Oleksii Kuchaiev|arXiv (Cornell University)|May 8, 2020
Speech Recognition and Synthesis参考文献 21被引用 20
一句话总结

本文表明,微调一个大规模预训练的英文QuartzNet自动语音识别(ASR)模型可显著提升在多种ASR任务中的性能,包括跨语言迁移(德语、西班牙语、俄语)、领域适应(财务收益电话会议)以及口音差异。该方法在小目标数据集上也持续优于从零开始训练,且在大规模数据设置下可将收敛速度加快至多18倍,预训练模型作为强正则化器,提升了泛化能力。

ABSTRACT

In this paper, we demonstrate the efficacy of transfer learning and continuous learning for various automatic speech recognition (ASR) tasks. We start with a pre-trained English ASR model and show that transfer learning can be effectively and easily performed on: (1) different English accents, (2) different languages (German, Spanish and Russian) and (3) application-specific domains. Our experiments demonstrate that in all three cases, transfer learning from a good base model has higher accuracy than a model trained from scratch. It is preferred to fine-tune large models than small pre-trained models, even if the dataset for fine-tuning is small. Moreover, transfer learning significantly speeds up convergence for both very small and very large target datasets.

研究动机与目标

  • 探究从预训练的英文ASR模型进行迁移学习是否能提升在低资源语言、口音和特定领域语音上的性能。
  • 评估在小规模或大规模目标数据集上,微调大预训练模型与从零开始训练的效果差异。
  • 研究持续学习中灾难性遗忘现象,并评估在微调过程中保留预训练数据的必要性。
  • 评估模型规模和学习率调度对迁移学习性能的影响。

提出的方法

  • 使用比预训练时小10倍的初始起始学习率,在目标数据集上微调预训练的QuartzNet编码器(15x5)。
  • 对于使用不同字母表的非英文语言,初始化一个新的浅层解码器;否则,加载预训练的解码器。
  • 所有实验均使用NeMo工具包,确保各任务间超参数一致。
  • 在微调过程中包含一部分原始预训练数据,以防止灾难性遗忘。
  • 在跨语言、跨口音和领域适应任务中,采用相同的迁移学习方案。
  • 在大规模金融数据(50,000+小时)上进行训练,比较预训练模型与从零开始训练模型在收敛速度和最终准确率上的差异。

实验结果

研究问题

  • RQ1微调预训练的英文ASR模型是否在低资源语言上表现优于从零开始训练?
  • RQ2在小目标数据集上微调时,模型规模如何影响迁移学习性能?
  • RQ3在大规模数据ASR训练中,迁移学习能否显著加快收敛速度?
  • RQ4在未保留预训练数据的情况下微调时,灾难性遗忘的程度如何?
  • RQ5相同的迁移学习方案是否能在不同类型ASR适配(跨语言、跨口音、领域特定)中保持泛化能力?

主要发现

  • 微调预训练的15x5 QuartzNet模型在德语Common Voice数据集上实现了23.35%的WER,优于从零开始训练的模型(30.42%)和更小的5x3模型(28.61%)。
  • 在俄语任务中,微调将WER从从零开始训练的59.50%降低至使用5D模型时的32.20%,表明在小数据上具有显著的正则化优势。
  • 在金融领域,预训练模型在18倍于从零开始训练模型的时间内达到了其最终准确率的90%。
  • 无论目标数据集规模是否比预训练数据大一个数量级,始终通过微调大预训练模型获得最佳性能。
  • 当在微调过程中未保留预训练数据时,发生了灾难性遗忘,证实了在持续学习中保留该数据的必要性。
  • 该方法在所有测试场景中均表现有效:跨语言、跨口音和领域适应,且始终优于从零开始训练的基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。