[论文解读] Masked Pre-trained Encoder base on Joint CTC-Transformer
该论文提出了一种两阶段半监督自动语音识别(ASR)框架,结合了掩码预训练编码器(MPE)与联合CTC-Transformer(JCT)模型。MPE通过使用双向Transformer对下采样后的声学帧进行掩码和重建,在大规模无标签语音数据上进行预训练;而JCT则利用少量有标签数据,通过CTC和注意力损失对编码器进行微调。该方法在仅使用30%有标签数据的情况下,相较于完全监督训练,在WSJ数据集上实现了22%的词错误率(WER)降低。
This study (The work was accomplished during the internship in Tencent AI lab) addresses semi-supervised acoustic modeling, i.e. attaining high-level representations from unsupervised audio data and fine-tuning the parameters of pre-trained model with supervised data. The proposed approach adopts a two-stage training framework, consisting of masked pre-trained encoder (MPE) and Joint CTC-Transformer (JCT). In the MPE framework, part of input frames are masked and reconstructed after the encoder with massive unsupervised data. In JCT framework, compared with original Transformer, acoustic features are applied as input instead of plain text. CTC loss performs as the prediction target on top of the encoder, and decoder blocks remain unchanged. This paper presents a comparison between two-stage training method and the fully supervised JCT. In addition, this paper investigates the our approach's robustness against different volumns of training data. Experiments on the two-stage training method deliver much better performance than fully supervised model. The word error rate (WER) with two-stage training which only exploits 30\% of WSJ labeled data achieves 17\% reduction than which trained by 50\% of WSJ in a fully supervised way. Moreover, increasing unlabeled data for MPE from WSJ (81h) to Librispeech (960h) attains about 22\% WER reduction.
研究动机与目标
- 通过利用大规模无标签语音数据,提升低资源自动语音识别(ASR)性能。
- 开发一种受BERT启发但针对语音任务进行适配的声学特征掩码预训练策略,通过帧级掩码和重建实现。
- 评估在不同有标签数据量下,该两阶段训练流程的鲁棒性与有效性。
- 将所提方法与现有自监督语音表征学习方法(如wav2vec和DeCoAR)进行比较。
提出的方法
- 在81小时或960小时无标签语音数据上训练掩码预训练编码器(MPE),通过掩码15%的下采样FBANK帧,并使用双向Transformer编码器重建这些帧。
- MPE使用L1损失最小化原始帧与重建帧之间的差异,通过Adam优化。
- 在小规模有标签数据集(如WSJ的1/3或1/2)上微调联合CTC-Transformer(JCT)模型,其中CTC损失作为共享编码器顶部的辅助预测头。
- 评估了两种微调策略:端到端微调和冻结编码器微调,后者表现更优。
- 将预训练的MPE特征用作高层表示,以在有限监督下提升下游ASR性能。
- 在WSJ和LibriSpeech数据集上评估该框架,比较不同数据配置和预训练数据规模下的WER表现。
实验结果
研究问题
- RQ1在大规模无标签语音数据上进行掩码预训练,是否能提升在少量有标签数据下的ASR性能?
- RQ2与使用相同有标签数据量的完全监督训练相比,两阶段MPE-JCT框架的性能如何?
- RQ3将无标签预训练数据量从81小时增加到960小时,对下游ASR准确率有何影响?
- RQ4与现有自监督语音表征方法(如wav2vec和DeCoAR)相比,所提MPE方法表现如何?
主要发现
- 两阶段MPE-JCT框架在WSJ dev93上实现22%的相对WER降低,在eval92上实现30%的降低,相较于使用相同有标签数据的完全监督训练。
- 使用在960小时LibriSpeech数据上预训练的MPE,当仅用30%有标签数据微调时,WSJ(81小时)的WER降低了22%。
- 在LibriSpeech数据集上,两阶段方法在dev-clean上将WER降低了34%,在test-clean上降低了25%,相较于完全监督基线。
- 冻结编码器微调策略优于端到端微调,在WSJ dev93上WER为10.43,而直接微调的WER为14.77。
- 在WSJ dev93上,与wav2vec相比,MPE方法实现了15%的相对WER降低;与DeCoAR相比,实现了7%的相对WER降低。
- MPE中的自注意力矩阵在训练过程中表现出更优的对齐能力,表明其有效学习了上下文表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。