Skip to main content
QUICK REVIEW

[论文解读] Large-scale ASR Domain Adaptation using Self- and Semi-supervised Learning

Dongseong Hwang, Ananya Misra|arXiv (Cornell University)|Oct 1, 2021
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

本论文提出一种用于大规模自动语音识别(ASR)领域自适应的联合自监督与半自监督学习方法,仅使用3%的标注目标域数据即可完全弥补与全数据基线之间的性能差距。该方法结合自监督预训练与置信度过滤的噪声学生训练,使目标域的词错误率(WER)相对降低13.5%,并在源域上实现更好的泛化能力。

ABSTRACT

Self- and semi-supervised learning methods have been actively investigated to reduce labeled training data or enhance the model performance. However, the approach mostly focus on in-domain performance for public datasets. In this study, we utilize the combination of self- and semi-supervised learning methods to solve unseen domain adaptation problem in a large-scale production setting for online ASR model. This approach demonstrates that using the source domain data with a small fraction of the target domain data (3%) can recover the performance gap compared to a full data baseline: relative 13.5% WER improvement for target domain data.

研究动机与目标

  • 解决大规模ASR系统中因训练数据(源域)与真实测试数据(目标域)存在领域差异而导致的领域不匹配问题。
  • 降低在生产环境中进行领域自适应时对大量标注目标域数据的依赖。
  • 探究自监督与半自监督学习在提升域外与域内ASR性能方面所起的互补作用。
  • 优化训练策略,以最小量的标注目标数据提升模型泛化能力。

提出的方法

  • 使用共享的因果音频编码器,联合训练RNN-T模型,同时优化RNN-T损失与自监督损失(如Wav2vec2.0、APC、Wav2vec)。
  • 采用多层感知机(MLP)适配器,使音频编码器的最终表示同时服务于RNN-T与自监督目标。
  • 利用非因果教师模型进行噪声学生训练(NST),为未标注的目标域数据生成伪标签。
  • 实施置信度估计模块(CEM),过滤低置信度的伪标签语音片段,提升标签质量与模型鲁棒性。
  • 采用联合训练策略,通过RNN-T损失引导,使Wav2vec2.0在因果编码器上实现收敛。
  • 通过联合使用标注源数据与过滤后的伪标签目标数据进行微调,损失加权超参数λ设为0.5。
Fig. 1 : Domain adaptation: Self-sup pre-trains the audio encoder. Supervised and semi-sup train all the modules.
Fig. 1 : Domain adaptation: Self-sup pre-trains the audio encoder. Supervised and semi-sup train all the modules.

实验结果

研究问题

  • RQ1在仅使用极少量标注目标数据的情况下,自监督与半自监督学习能否联合弥补大规模ASR系统中的域外泛化差距?
  • RQ2自监督与半自监督学习在领域自适应与域内性能提升方面分别发挥何种不同作用?
  • RQ3在因果在线ASR模型中,结合自监督预训练与半自监督微调的最优训练策略为何?
  • RQ4对伪标签进行置信度过滤如何影响模型在源域与目标域上的性能表现?
  • RQ5RNN-T与自监督目标的联合训练能否克服在因果Wav2vec2.0训练中的收敛问题?

主要发现

  • 仅使用3%的标注目标域数据,结合自监督与半自监督学习,使目标域的词错误率(WER)相比全数据基线实现13.5%的相对降低。
  • 该联合方法使目标域WER降至3.1%(MF),源域WER降至5.7%(SF),优于使用100%目标数据的监督训练方法。
  • 自监督学习提升了模型的整体泛化能力,而半自监督学习则直接缩小了域外泛化差距。
  • 置信度过滤使24%的目标域语音片段被剔除,但将目标域WER从3.2%降至3.1%,源域WER从5.8%降至5.7%。
  • RNN-T与自监督损失的联合训练使Wav2vec2.0在因果编码器上成功收敛,WER达到4.3%,优于独立的Wav2vec2.0预训练方法。
  • 与两阶段预训练加微调相比,该联合训练方法将总训练步数减少高达80%,实现更快收敛与更优最终性能。
Fig. 2 : Comparison of WER convergence with and without Joint train for wav2vec and wav2vec2.0.
Fig. 2 : Comparison of WER convergence with and without Joint train for wav2vec and wav2vec2.0.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。