[论文解读] AISPEECH-SJTU accent identification system for the Accented English Speech Recognition Challenge
本论文介绍了AISPEECH-SJTU系统,该系统在Interspeech-2020口音英语语音识别挑战赛中取得了83.63%的平均准确率,排名首位。该系统引入了基于ASR的音素后验概率图(PPG)特征用于口音识别,采用了一种新颖的TTS数据增强方法以合成多样化的口音数据,并应用了测试时数据增强和分层多嵌入融合技术,以在训练数据有限的情况下提升性能。
This paper describes the AISpeech-SJTU system for the accent identification track of the Interspeech-2020 Accented English Speech Recognition Challenge. In this challenge track, only 160-hour accented English data collected from 8 countries and the auxiliary Librispeech dataset are provided for training. To build an accurate and robust accent identification system, we explore the whole system pipeline in detail. First, we introduce the ASR based phone posteriorgram (PPG) feature to accent identification and verify its efficacy. Then, a novel TTS based approach is carefully designed to augment the very limited accent training data for the first time. Finally, we propose the test time augmentation and embedding fusion schemes to further improve the system performance. Our final system is ranked first in the challenge and outperforms all the other participants by a large margin. The submitted system achieves 83.63\% average accuracy on the challenge evaluation data, ahead of the others by more than 10\% in absolute terms.
研究动机与目标
- 解决仅有160小时带口音英语数据的低资源口音识别挑战。
- 通过有效利用辅助的Librispeech数据集,提升模型的鲁棒性和泛化能力。
- 通过专为口音建模设计的新颖数据增强技术,克服数据稀缺问题。
- 通过测试时数据增强和嵌入融合策略,提升系统性能。
提出的方法
- 系统使用在混合带口音数据和Librispeech数据上训练的ASR模型,提取与说话人无关的音素后验概率图(PPG)特征,用于口音分类。
- 提出一种新颖的基于TTS的数据增强方法,合成包含说话人、信道和文本多样性的多种口音变体,以丰富训练数据。
- 在测试时应用数据增强,通过生成测试语音的多个扰动版本,并对预测结果取平均,以提高鲁棒性。
- 采用分层多嵌入联合模型,融合多个训练模型的嵌入表示,以提升最终分类性能。
- 在ASR训练过程中应用常规数据增强(如噪声、混响和时间扭曲),以提升PPG特征质量。
- 最终系统采用从高性能配置初始化的多个模型的融合,最终分类器在融合嵌入表示上进行端到端训练。
实验结果
研究问题
- RQ1从ASR模型中提取的音素后验概率图(PPG)特征,是否能优于传统低层次特征(如FBANK)在口音识别中的表现?
- RQ2基于TTS的数据增强在低资源口音识别任务中能多大程度上提升性能?
- RQ3测试时数据增强在降低未见测试数据上的预测方差和提升泛化能力方面有多有效?
- RQ4通过融合多种模型预测结果,分层多嵌入联合模型是否能进一步提升系统准确率?
主要发现
- 基于PPG的系统在开发集上相比挑战赛基线实现了15.03%的绝对性能提升,证明了任务特定且与说话人无关的特征具有优越性。
- 基于TTS的数据增强在不同设置下使系统准确率提升了2.15%至4.17%,显著增强了模型鲁棒性。
- 测试时数据增强带来了微小但稳定的性能提升,证实了其在降低预测方差方面的价值。
- 最终系统在测试集上实现了83.63%的平均准确率,排名第一,比第二名团队高出11.23个百分点。
- 与基线相比,系统在开发集和测试集之间的性能差距更小,表明泛化能力更强。
- t-SNE可视化显示,印度(IND)口音被良好分离,而美国(US)口音与其他口音高度重叠,解释了其识别准确率较低的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。