[论文解读] Unsupervised Pre-training of Bidirectional Speech Encoders via Masked Reconstruction
本文提出一种基于连续谱图输入的双向语音编码器掩码重建预训练方法,通过随机掩码时间与频率段并让模型重建这些部分。该方法在LibriSpeech和Wall Street Journal数据集上均显著提升了语音识别准确率,尤其在大规模无标签数据上进行预训练并结合微调阶段的领域自适应时效果更佳。
We propose an approach for pre-training speech representations via a masked reconstruction loss. Our pre-trained encoder networks are bidirectional and can therefore be used directly in typical bidirectional speech recognition models. The pre-trained networks can then be fine-tuned on a smaller amount of supervised data for speech recognition. Experiments with this approach on the LibriSpeech and Wall Street Journal corpora show promising results. We find that the main factors that lead to speech recognition improvements are: masking segments of sufficient width in both time and frequency, pre-training on a much larger amount of unlabeled data than the labeled data, and domain adaptation when the unlabeled and labeled data come from different domains. The gain from pre-training is additive to that of supervised data augmentation.
研究动机与目标
- 通过双向语音编码器的无监督预训练来提升语音识别性能。
- 将BERT风格的掩码重建方法适配到语音信号的连续、高粒度特性上。
- 研究掩码策略、预训练数据规模以及领域不匹配对识别性能的影响。
- 在有无数据增强的情况下,对基于音素和基于字符的ASR系统评估该方法。
- 展示当预训练与微调数据在领域上不一致时,通过线性输入网络(LIN)实现领域自适应的有效性。
提出的方法
- 在大规模无标签语音数据上使用掩码重建损失预训练双向RNN。
- 在时间和频率域应用随机掩码:时间域为连续段,频率域为各时间步的随机通道。
- 以谱图特征作为输入,实现时间-频率联合掩码,更好地建模语音的连续性。
- 使用标准ASR训练流程在小规模有标签数据集上微调预训练模型。
- 通过可学习的线性输入网络(LIN)实现领域自适应,该网络在微调初期阶段进行更新。
- 通过开发集调优,优化掩码宽度和掩码数量等超参数。

实验结果
研究问题
- RQ1BERT风格的掩码重建能否有效适配到连续语音信号上,用于无监督预训练?
- RQ2掩码策略(掩码宽度和时间/频率段数量)如何影响下游ASR性能?
- RQ3在大规模无标签数据上预训练与在有限有标签数据上预训练相比,性能影响如何?
- RQ4预训练与微调数据之间的领域不匹配如何影响性能,是否可以缓解?
- RQ5预训练带来的性能增益是否与监督数据增强方法(如SpecAugment)的增益具有叠加效应?
主要发现
- 在960小时无标签LibriSpeech数据上进行预训练,显著提升了si284和WSJ测试集上的ASR性能。
- 在si284测试集上,预训练将基于音素的WER从基线的18.52%降低至15.56%(使用SpecAugment时),进一步降至14.92%(同时使用预训练和SpecAugment时)。
- 对于基于字符的系统,预训练将CER从基线的15.23%降低至11.70%(使用SpecAugment和LIN自适应时)。
- 预训练与SpecAugment的结合带来叠加增益,当两者同时应用时,测试集WER降至6.33%。
- 当预训练与微调数据来自不同领域时,通过LIN实现的领域自适应能持续提升性能,尤其在WSJ数据集上效果显著。
- 学习曲线显示,预训练模型收敛更快,泛化能力更强,CER和CTC损失更低,表明过拟合程度更低。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。