[论文解读] Improving Accent Identification and Accented Speech Recognition Under a Framework of Self-supervised Learning
本论文提出了一种自监督学习框架,通过标准差约束损失(SDC-loss)改进端到端的口音识别,并引入帧级口音特征以实现动态、与口音相关的自动语音识别(ASR)。该方法在AESRC2020数据集上相较无口音依赖的基线模型实现了6.5%的相对WER降低,通过在960小时未标注的LibriSpeech数据上进行联合预训练与微调,显著提升了性能。
Recently, self-supervised pre-training has gained success in automatic speech recognition (ASR). However, considering the difference between speech accents in real scenarios, how to identify accents and use accent features to improve ASR is still challenging. In this paper, we employ the self-supervised pre-training method for both accent identification and accented speech recognition tasks. For the former task, a standard deviation constraint loss (SDC-loss) based end-to-end (E2E) architecture is proposed to identify accents under the same language. As for accented speech recognition task, we design an accent-dependent ASR system, which can utilize additional accent input features. Furthermore, we propose a frame-level accent feature, which is extracted based on the proposed accent identification model and can be dynamically adjusted. We pre-train our models using 960 hours unlabeled LibriSpeech dataset and fine-tune them on AESRC2020 speech dataset. The experimental results show that our proposed accent-dependent ASR system is significantly ahead of the AESRC2020 baseline and achieves $6.5\%$ relative word error rate (WER) reduction compared with our accent-independent ASR system.
研究动机与目标
- 解决自动语音识别(ASR)系统中因口音导致的语音可变性建模挑战。
- 开发一种鲁棒的端到端口音识别模型,通过一种新颖的标准差约束损失(SDC-loss)避免过拟合。
- 设计一种与口音相关的ASR系统,通过动态利用帧级口音特征以提升对带口音语音的识别性能。
- 在缺乏真实口音类别标注的低资源场景下,通过识别模型生成可靠的口音特征,实现有效的ASR。
- 证明大规模未标注数据的自监督预训练在提升口音识别与带口音语音识别性能方面的有效性。
提出的方法
- 提出一种标准差约束损失(SDC-loss),通过强制帧级口音预测的一致性来减少过拟合。
- 设计一种端到端(E2E)口音识别模型,对每个音频帧预测口音,并通过平均池化聚合预测结果。
- 从口音识别模型中提取帧级口音特征,根据帧级置信度动态加权。
- 开发一种与口音相关的ASR系统,将帧级口音特征作为偏置注入Transformer编码器的注意力机制中。
- 采用两阶段训练策略:首先在960小时未标注的LibriSpeech数据上使用wav2vec 2.0进行预训练,随后在AESRC2020数据集上进行微调。
- 采用加权口音偏置机制,其中每个帧的口音特征重要性由学习得到的权重 $ w_i $ 决定,实现动态自适应。
实验结果
研究问题
- RQ1在相同语言下,具有新颖SDC-loss的自监督框架是否能提升端到端口音识别性能?
- RQ2引入帧级口音特征如何提升与口音相关的ASR系统的性能?
- RQ3当缺乏真实口音标签时,自监督预训练模型在多大程度上能提升带口音语音识别性能?
- RQ4在ASR架构中,口音相关偏置的最佳放置位置与形式是什么,以实现WER降低的最大化?
- RQ5与固定或均匀的偏置注入相比,帧级口音特征的动态加权方式在ASR中表现如何?
主要发现
- 所提出的与口音相关的ASR系统在AESRC2020数据集上相较无口音依赖的基线模型实现了6.5%的相对词错误率(WER)降低。
- 在未提供真实口音标签的情况下,采用帧级口音特征的模型(AR₅)在全测试集上达到7.02%的WER,接近使用真实标签系统的性能。
- 消融实验表明,将口音相关偏置置于CNN和Transformer层之后的性能最佳,优于早期或后期注入。
- 使用动态权重 $ w_i $ 的帧级口音特征显著优于均匀加权,AR₅优于AR₇的实验结果证明了这一点。
- 采用4-gram语言模型的模型在全测试集上达到4.52%的WER,相较AESRC2020基线实现36.1%的相对WER降低。
- SDC-loss有效减少了口音识别中的过拟合,表现为在不同口音类别上性能稳定,且在消融实验中表现出强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。