[论文解读] Accent-Robust Automatic Speech Recognition Using Supervised and Unsupervised Wav2vec Embeddings
本论文提出了一种使用领域自适应训练(DAT)和多任务学习(MTL)的语音识别(ASR)方法,以提升对口音的鲁棒性,结合了有监督和无监督的wav2vec嵌入。结果表明,使用有监督嵌入的DAT在整体性能上表现最佳,而使用wav2vec嵌入的MTL在未见口音上表现更优,且当训练标签被污染或不可用时,wav2vec嵌入优于有标签嵌入。
Speech recognition models often obtain degraded performance when tested on speech with unseen accents. Domain-adversarial training (DAT) and multi-task learning (MTL) are two common approaches for building accent-robust ASR models. ASR models using accent embeddings is another approach for improving robustness to accents. In this study, we perform systematic comparisons of DAT and MTL approaches using a large volume of English accent corpus (4000 hours of US English speech and 1244 hours of 20 non-US-English accents speech). We explore embeddings trained under supervised and unsupervised settings: a separate embedding matrix trained using accent labels, and embeddings extracted from a fine-tuned wav2vec model. We find that our DAT model trained with supervised embeddings achieves the best performance overall and consistently provides benefits for all testing datasets, and our MTL model trained with wav2vec embeddings are helpful learning accent-invariant features and improving novel/unseen accents. We also illustrate that wav2vec embeddings have more advantages for building accent-robust ASR when no accent labels are available for training supervised embeddings.
研究动机与目标
- 在低资源环境下提升对多样化英语口音(尤其是未见口音)的ASR鲁棒性。
- 系统性地比较在DAT和MTL设置下,有监督与无监督wav2vec嵌入在口音鲁棒性ASR中的表现。
- 评估标签质量对有监督嵌入的影响,以及在标签不可靠或缺失时,无监督wav2vec嵌入的优势。
- 探究wav2vec嵌入是否能在无显式口音标注的情况下学习到口音不变的表征。
提出的方法
- 使用领域自适应训练(DAT)训练基于Transformer的CTC ASR模型,通过最小化不同口音之间的可区分性,学习口音不变的表征。
- 通过联合训练ASR模型与辅助口音分类头,应用多任务学习(MTL),以鼓励学习解耦的、口音不变的特征。
- 有监督嵌入通过在真实口音标签上训练的独立嵌入矩阵学习,而无监督wav2vec嵌入则从微调后的wav2vec 2.0模型中提取。
- 模型采用拼接和加权求和两种融合策略,将输入嵌入与声学特征结合。
- 应用口音重映射技术,通过基于区域相似性的标签重分配,提升泛化能力,尤其针对非美式口音。
- 消融研究通过引入10%–50%的标签污染,模拟现实中的标签噪声,并与wav2vec嵌入的性能进行对比。
实验结果
研究问题
- RQ1使用有监督嵌入的领域自适应训练(DAT)是否在口音鲁棒性ASR中优于使用相同嵌入的多任务学习(MTL)?
- RQ2与有标签的有监督嵌入相比,使用无监督wav2vec嵌入在未见口音和标签噪声下的鲁棒性如何?
- RQ3当真实口音标签部分被污染或不可用时,使用wav2vec嵌入能带来多大的性能提升?
- RQ4口音重映射技术是否能提升DAT和MTL框架下非美式英语口音的泛化能力?
- RQ5wav2vec嵌入是否能在无显式口音标注的情况下有效学习口音不变的表征?
主要发现
- 使用有监督嵌入训练的DAT模型在非美式口音上达到最低整体词错误率(WER)16.4%,整体WER为17.3%,优于所有其他配置。
- 使用wav2vec嵌入的MTL模型(MTL2-w2v(S))在新口音上表现最佳,WER为16.3%,优于基线模型。
- 当训练标签污染比例为10%–25%时,wav2vec嵌入始终优于有标签嵌入,有标签嵌入的WER在25%污染时上升至17.3%,而wav2vec嵌入的WER保持在17.3%。
- 口音重映射技术提升了非美式口音的表现,尤其在DAT3-w2v(S)和MTL3-w2v(S)中,非美式口音和新口音的WER最高降低0.3%。
- 未训练嵌入在新口音上的表现优于en_us嵌入,表明预训练的wav2vec表征比单一口音微调的嵌入泛化能力更强。
- 消融研究证实,在标签噪声下,wav2vec嵌入比有标签嵌入更鲁棒,即使标签污染率达50%,wav2vec的WER仍稳定在17.3%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。