Skip to main content
QUICK REVIEW

[论文解读] Self-training and Pre-training are Complementary for Speech Recognition

Qiantong Xu, Alexei Baevski|arXiv (Cornell University)|Oct 22, 2020
Speech Recognition and Synthesis参考文献 37被引用 13
一句话总结

本论文表明,自训练(伪标签)与使用 wav2vec 2.0 的无监督预训练在语音识别任务中具有互补性,仅使用 10 分钟标注数据和 53,000 小时无标注 LibriVox 数据,即可在极低资源条件下实现最先进性能:在 LibriSpeech 的 clean/other 测试集上分别达到 3.0%/5.2% 的 WER,媲美一年前使用 960 小时标注数据训练的系统。

ABSTRACT

Self-training and unsupervised pre-training have emerged as effective approaches to improve speech recognition systems using unlabeled data. However, it is not clear whether they learn similar patterns or if they can be effectively combined. In this paper, we show that pseudo-labeling and pre-training with wav2vec 2.0 are complementary in a variety of labeled data setups. Using just 10 minutes of labeled data from Libri-light as well as 53k hours of unlabeled data from LibriVox achieves WERs of 3.0%/5.2% on the clean and other test sets of Librispeech - rivaling the best published systems trained on 960 hours of labeled data only a year ago. Training on all labeled data of Librispeech achieves WERs of 1.5%/3.1%.

研究动机与目标

  • 探究自训练与无监督预训练在语音识别中是否具有互补性,而非学习相似表征。
  • 评估在标注数据稀缺的低资源设置下,将 wav2vec 2.0 预训练与伪标签法结合的有效性。
  • 理解在伪标签生成过程中使用的语言模型在最终声学模型中是否被蒸馏。
  • 分析标注数据与无标注数据比例对结合两种方法后性能提升的影响。

提出的方法

  • 在 53,000 小时无标注 LibriVox 音频上,通过掩码潜在表征的对比学习,预训练 wav2vec 2.0 模型。
  • 在可用的标注数据(如 LibriSpeech 中的 10 分钟或 960 小时)上微调预训练的 wav2vec 2.0 模型,以构建初始声学模型。
  • 使用微调后的模型与语言模型,为整个无标注 LibriVox 数据集生成伪标签。
  • 从头开始训练最终声学模型,或在原始标注数据与伪标签数据的并集上进行微调。
  • 通过比较从头训练的序列到序列模型与 CTC 微调模型的性能,评估知识蒸馏效应。
  • 通过固定实验中标注数据与无标注数据的比例,控制数据比例变量,以隔离数据量与方法组合的独立影响。

实验结果

研究问题

  • RQ1自训练与无监督预训练在语音识别中是否具有互补性,还是学习了重叠的表征?
  • RQ2在仅使用极少标注数据的低资源设置下,将 wav2vec 2.0 预训练与伪标签法结合是否能显著提升性能?
  • RQ3在推理时未使用外部语言模型的情况下,伪标签生成过程中使用的语言模型在最终声学模型中被蒸馏的程度如何?
  • RQ4标注数据与无标注数据的比例如何影响结合两种方法后的相对性能增益?

主要发现

  • 将 wav2vec 2.0 预训练与自训练结合,在仅使用 10 分钟标注数据和 53,000 小时无标注 LibriVox 数据的条件下,可在 LibriSpeech 的 clean 与 other 测试集上分别实现 3.0%/5.2% 的 WER,相较于仅使用预训练的模型,相对 WER 分别降低 25% 和 40%。
  • 即使在推理时未使用语言模型,自训练模型在 10 分钟设置下仍可达到 3.7%/6.5% 的 WER,表明伪标签生成阶段使用的语言模型知识已被有效蒸馏至声学模型中。
  • 在使用全部 960 小时标注数据时,结合方法的性能达到 1.5%/3.1% 的 WER,与一年前使用 960 小时标注数据训练的最先进系统相当或更优。
  • 结合方法带来的相对性能提升主要由无标注数据与标注数据的比例决定,而非标注数据的绝对数量;当比例保持恒定时,不同标注数据规模下均表现出一致的相对增益。
  • 在高数据规模场景下,从伪标签数据上从头训练的序列到序列模型优于 CTC 微调模型,表明复杂解码器能更有效地利用伪标签数据并蒸馏语言模型知识。
  • 在伪标签数据上微调预训练的 wav2vec 2.0 模型,性能低于从头训练,表明预训练表征可能并非伪标签数据分布的最优选择,而从头训练能更好地适应伪标签数据分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。