[论文解读] A Further Study of Unsupervised Pre-training for Transformer Based Speech Recognition
本论文研究了基于Transformer的自动语音识别中,用于无监督预训练的掩码预测编码(MPC),表明匹配预训练数据发音风格可提升下游性能;将MPC与自回归预测编码(APC)结合,可在HKUST数据集上使流式模型准确率提升8.46%相对误差减少;通过目标数据适应与逐层判别性微调,AISHELL数据集上实现3.99%相对误差减少。
Building a good speech recognition system usually requires large amounts of transcribed data, which is expensive to collect. To tackle this problem, many unsupervised pre-training methods have been proposed. Among these methods, Masked Predictive Coding achieved significant improvements on various speech recognition datasets with BERT-like Masked Reconstruction loss and Transformer backbone. However, many aspects of MPC have not been fully investigated. In this paper, we conduct a further study on MPC and focus on three important aspects: the effect of pre-training data speaking style, its extension on streaming model, and how to better transfer learned knowledge from pre-training stage to downstream tasks. Experiments reveled that pre-training data with matching speaking style is more useful on downstream recognition tasks. A unified training objective with APC and MPC provided 8.46% relative error reduction on streaming model trained on HKUST. Also, the combination of target data adaption and layer-wise discriminative training helped the knowledge transfer of MPC, which achieved 3.99% relative error reduction on AISHELL over a strong baseline.
研究动机与目标
- 研究预训练数据发音风格对下游自动语音识别(ASR)性能的影响。
- 将MPC适配于需要自回归或因果注意力机制的流式语音识别模型。
- 通过有效的微调策略,提升预训练MPC模型向下游ASR任务的知识迁移能力。
- 评估将MPC与其他预训练目标(如APC)结合在流式与非流式设置下的影响。
- 探索目标数据适应与逐层判别性学习等技术,以增强知识迁移效果。
提出的方法
- 使用FBANK特征对Transformer编码器进行MPC预训练,采用动态掩码策略,其中15%的4帧块被掩码,模型通过L1损失预测被掩码部分。
- 在编码器中应用时间下采样,并重塑输出以匹配输入维度,用于MPC损失计算。
- 将APC(自回归预测编码)与MPC整合到统一的预训练目标中,以50%的概率交替使用两者。
- 通过乘以λ^||l−θ||的方式实现逐层判别性初始速率调度,其中λ=0.95,θ=5.5,以保留中间编码层的知识。
- 通过在目标域数据上微调以实现目标数据适应,并将其与判别性学习率调度结合。
- 采用多任务学习策略,通过衰减的MPC损失权重(γ_mpc)平衡预训练与下游任务信号,初始值为0.2,每5个周期减半。

实验结果
研究问题
- RQ1预训练数据的发音风格是否影响下游ASR性能?与目标数据风格匹配是否有益?
- RQ2MPC能否有效应用于依赖自回归或因果注意力机制的流式ASR模型?
- RQ3如何更好地将预训练MPC模型的知识迁移至下游ASR任务?
- RQ4在预训练中结合MPC与APC对流式模型有何影响?
- RQ5目标数据适应与逐层判别性训练是否能协同提升MPC微调中的知识迁移效果?
主要发现
- 使用与目标领域风格匹配的预训练数据,可显著提升下游ASR性能。
- 在预训练中结合MPC与APC,相较于强基线模型,使流式HKUST模型实现8.46%相对误差减少。
- 在AISHELL数据集上,结合目标数据适应与逐层判别性训练,相较强基线实现3.99%相对误差减少。
- 逐层判别性学习率调度有助于保留中间编码层的知识,提升微调的稳定性和性能。
- 采用衰减MPC损失权重的多任务学习带来微小增益,但目标数据适应与逐层调度的结合带来最一致的性能提升。
- 仅当同时应用目标数据适应与逐层学习率调度时,知识迁移效果才得到显著增强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。