[论文解读] Learning Robust and Multilingual Speech Representations
本文提出了一种对比预测编码(CPC)模型,该模型在8,000小时的多样化、嘈杂且多语言的语音数据上进行预训练,以学习鲁棒且可迁移的语音表征。该方法在25种语音上具有多样性的语言(包括声调语言和低资源语言)中,显著提升了域外鲁棒性和零样本迁移性能,优于标准的对数滤波器组特征以及仅在干净英语数据上预训练的模型。
Unsupervised speech representation learning has shown remarkable success at finding representations that correlate with phonetic structures and improve downstream speech recognition performance. However, most research has been focused on evaluating the representations in terms of their ability to improve the performance of speech recognition systems on read English (e.g. Wall Street Journal and LibriSpeech). This evaluation methodology overlooks two important desiderata that speech representations should have: robustness to domain shifts and transferability to other languages. In this paper we learn representations from up to 8000 hours of diverse and noisy speech data and evaluate the representations by looking at their robustness to domain shifts and their ability to improve recognition performance in many languages. We find that our representations confer significant robustness advantages to the resulting recognition systems: we see significant improvements in out-of-domain transfer relative to baseline feature sets and the features likewise provide improvements in 25 phonetically diverse languages including tonal languages and low-resource languages.
研究动机与目标
- 开发对领域分布偏移具有鲁棒性且可在不同语言间迁移的语音表征,以解决现有无监督预训练方法的局限性。
- 评估大规模、多样化预训练是否能超越标准语音识别基准上的域内性能,提升泛化能力。
- 评估无监督表征在数据稀缺为主要挑战的低资源语言和声调语言中的有效性。
- 证明预训练中的规模与多语言多样性可带来更具不变性与泛化能力的特征。
提出的方法
- 该方法采用扩展的对比预测编码(CPC)框架,结合双向预测建模与密集残差连接,从原始音频中学习上下文表征。
- 使用卷积编码器将音频编码为潜在表征,随后通过自回归上下文网络对过去和未来的表征进行建模,以实现对比预测。
- 通过最大化上下文表征与未来表征之间的互信息,促进学习分层且有意义的声学结构。
- 预训练在最多8,000小时的多样化、嘈杂且多语言的语音数据上进行,涵盖低资源语言和声调语言。
- 在LibriSpeech上使用这些表征微调下游自动语音识别(ASR)模型,并在域外和跨语言迁移设置下进行评估。
- 评估包括域内WER与域外迁移性能,同时与对数滤波器组特征及仅在LibriSpeech上预训练的模型进行消融比较。
实验结果
研究问题
- RQ1在大规模、多样化且嘈杂的语音数据上进行预训练,是否能提升语音识别对领域分布偏移的鲁棒性?
- RQ2从多语言数据中学习到的表征在低资源语言和声调语言中的迁移程度如何?
- RQ3在域外设置下,基于8,000小时多语言数据训练的表征与标准特征及仅在LibriSpeech上预训练的模型相比,性能如何?
- RQ4从大规模未转录语音中进行无监督表征学习,是否能隐式发现跨语言的语音结构?
主要发现
- 在100%训练数据上训练时,该表征在LibriSpeech测试集-clean上达到13.92%的WER,在测试集-other上达到19.10%,优于对数滤波器组特征(19.83%和41.26%)以及CPC-LibriSpeech模型(15.07%和36.05%)。
- 在10%训练数据下,该模型在测试集-clean上达到13.69%的WER,在测试集-other上达到32.81%,显著优于基线对数滤波器组特征(19.65%和41.26%)以及CPC-LibriSpeech模型(14.96%和36.05%)。
- 结合语言模型解码后,该模型在测试集-clean上的WER降低至8.86%,在测试集-other上为14.47%,优于次优方法(CPC-LibriSpeech:9.41%和16.06%)。
- 该表征在25种语音上具有多样性的语言中表现出强大的零样本迁移性能,包括低资源语言和声调语言,如阿姆哈拉语、丰贝语、斯瓦希里语和沃洛夫语。
- 该模型在领域分布偏移方面表现出显著鲁棒性,与标准特征及仅在LibriSpeech上预训练的模型相比,域外迁移性能持续提升。
- 结果证实,预训练中的规模与多语言多样性对于学习跨领域和跨语言泛化的表征至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。