[论文解读] The Accented English Speech Recognition Challenge 2020: Open Datasets, Tracks, Baselines, Results and Methods
本论文介绍了2020年带 accents 的英语语音识别挑战赛,发布了一个包含10种英语口音的180小时开放数据集,用于口音识别(赛道1)和带口音的语音识别(赛道2)。该研究评估了使用自监督预训练(如wav2vec2.0)、数据增强和混合解码的端到端自动语音识别(ASR)模型,通过两遍解码实现最高26.4%的词错误率(WER)降低,通过多任务口音训练实现3%的相对WER提升。
The variety of accents has posed a big challenge to speech recognition. The Accented English Speech Recognition Challenge (AESRC2020) is designed for providing a common testbed and promoting accent-related research. Two tracks are set in the challenge -- English accent recognition (track 1) and accented English speech recognition (track 2). A set of 160 hours of accented English speech collected from 8 countries is released with labels as the training set. Another 20 hours of speech without labels is later released as the test set, including two unseen accents from another two countries used to test the model generalization ability in track 2. We also provide baseline systems for the participants. This paper first reviews the released dataset, track setups, baselines and then summarizes the challenge results and major techniques used in the submissions.
研究动机与目标
- 建立一个通用的测试平台,以推动带口音英语语音识别和口音识别的研究。
- 通过一个大规模、多样化的10种英语口音数据集,解决模型在未见口音上的泛化挑战。
- 评估自监督预训练、数据增强和端到端建模在低资源带口音ASR中的有效性。
- 在标准化评估协议下,比较不同架构(包括Transformer、Conformer和混合系统)在多语种口音识别中的性能。
提出的方法
- 挑战赛使用160小时训练集(包含8种口音:中文、美式、英式、韩语、日语、俄语、印地语、葡萄牙语)和20小时测试集(包含2种未见口音:西班牙语、加拿大英语)。
- 基线系统采用类似wav2vec2.0的自监督预训练方法,结合对比损失和多样性损失,以学习上下文相关的声学表征。
- 数据增强技术(如音量和速度扰动)使表现最佳的系统WER降低5–10%。
- 端到端模型,尤其是基于Transformer和Conformer的架构,通过利用全序列建模和注意力机制,优于传统混合系统。
- 采用语言模型重排序的两遍解码(如使用子词级别Transformer语言模型)使WER最高降低26.4%。
- 通过添加口音识别头进行多任务训练,在带口音ASR中实现3%的相对WER降低,表明显式口音建模具有优势。

实验结果
研究问题
- RQ1自监督预训练(如wav2vec2.0)在提升低资源带口音英语语音识别性能方面效果如何?
- RQ2速度扰动和噪声注入等数据增强技术在带口音语音识别中多大程度上提升了泛化能力?
- RQ3具有注意力机制的端到端模型是否能在多语种口音识别中超越传统的HMM-GMM混合系统?
- RQ4使用神经语言模型重排序的两遍解码在带口音语音识别中对WER降低有何影响?
- RQ5通过辅助口音识别头进行多任务训练是否能提升在未见口音上的性能?
主要发现
- 使用对比损失和多样性损失的自监督预训练显著提升了ASR性能,基于wav2vec2.0的模型取得了最先进结果。
- 通过音量和速度扰动进行数据增强使表现最佳的系统WER降低5–10%,而噪声和混响增强未表现出明显优势。
- 采用语言模型重排序的两遍解码使最佳系统(S2团队)WER降低最高达26.4%。
- 将子词级别Transformer语言模型与4-gram语言模型通过融合方式结合,使开发集WER相对降低2.4%(从3.73%降至3.64%)。
- 通过添加口音识别头进行多任务训练实现了3%的相对WER降低,表明显式口音建模具有价值。
- Conformer和轻量化Transformer变体优于标准Transformer,表明改进的局部上下文建模可提升性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。