[论文解读] UniSpeech at scale: An Empirical Study of Pre-training Method on Large-Scale Speech Recognition Dataset
本文研究了在包含65,000小时标注英语美式语音数据和155,000小时未标注数据的大规模语音识别数据集上,使用UniSpeech的多任务预训练进行自监督学习(SSL)的有效性。结果表明,同时使用对比损失和转换器损失的多任务预训练显著提升了在域外及带有口音语音上的性能,而在域内数据上SSL带来的增益却很小,这挑战了‘随着标注数据增多,SSL收益会减少’的普遍假设。
Recently, there has been a vast interest in self-supervised learning (SSL) where the model is pre-trained on large scale unlabeled data and then fine-tuned on a small labeled dataset. The common wisdom is that SSL helps resource-limited tasks in which only a limited amount of labeled data is available. The benefit of SSL keeps diminishing when the labeled training data amount increases. To our best knowledge, at most a few thousand hours of labeled data was used in the study of SSL. In contrast, the industry usually uses tens of thousands of hours of labeled data to build high-accuracy speech recognition (ASR) systems for resource-rich languages. In this study, we take the challenge to investigate whether and how SSL can improve the ASR accuracy of a state-of-the-art production-scale Transformer-Transducer model, which was built with 65 thousand hours of anonymized labeled EN-US data.
研究动机与目标
- 调查当存在大规模标注数据时,自监督学习(SSL)是否仍能提升自动语音识别(ASR)性能,反驳‘随着标注数据增多,SSL收益会减少’的普遍观点。
- 评估UniSpeech的多任务预训练(结合对比损失和转换器损失)在基于65,000小时匿名英语美式数据训练的生产规模ASR系统中的有效性。
- 评估SSL预训练是否能增强在域外及带有口音语音上的鲁棒性,特别是在流式(在线)ASR场景中。
- 将多任务预训练与仅使用对比损失的预训练进行比较,以确定在大规模设置下各组件的贡献。
提出的方法
- 使用包含65,000小时标注数据和155,000小时未标注数据的220,000小时混合语音语料,对Transformer-Transducer模型进行预训练,预训练过程中同时使用对比损失和转换器损失。
- 在原始wav2vec 2.0框架中,将量化器替换为线性投影层,以提升大规模数据上的训练稳定性和速度。
- 仅使用标注数据,以流式方式微调预训练模型,评估其在实时推理场景下的性能表现。
- 通过仅使用对比损失(移除转换器损失)进行预训练,开展消融研究,以隔离多任务学习的贡献。
- 使用fbank特征作为输入,在预训练阶段联合优化对比损失和转换器目标。
- 在域内(清晰,16K Hz)和域外(8K Hz,嘈杂,带有口音)测试集上评估性能,以衡量模型的域泛化能力。
实验结果
研究问题
- RQ1当已有65,000小时标注数据时,使用大规模未标注数据进行自监督预训练是否仍能提升ASR准确率?
- RQ2在高资源环境下,多任务预训练(对比损失 + 转换器损失)与仅使用对比损失的预训练相比如何?
- RQ3在多样化域外未标注数据上进行预训练,能在多大程度上提升在低资源或分布偏移测试集上的鲁棒性?
- RQ4当存在大量标注数据时,SSL预训练是否能有效支持流式(在线)ASR系统?
主要发现
- UniSpeech在8K Hz测试集上实现了15.17%的相对WER降低(23.39% vs. 27.69%的基线),表现出强大的域泛化能力。
- 在16K Hz测试集上,UniSpeech实现了8.26%的相对WER降低(17.76% vs. 19.36%),表明在域外数据上具有持续的性能提升。
- 在带有口音的英语测试集上,UniSpeech实现了4.08%至7.2%的相对增益,尤其在非加拿大口音上提升最大,表明对说话人差异具有鲁棒性。
- 消融研究显示,若移除多任务预训练,16K Hz测试集上的相对WER将增加12.2%,8K Hz测试集则增加19.1%,证明多任务学习对域外性能至关重要。
- 仅使用对比损失进行预训练的性能甚至劣于基线模型,表明在存在大规模标注数据时,仅对比损失的预训练无法提供良好的模型初始化。
- 在微调过程中,UniSpeech的验证转换器损失显著低于消融模型,表明联合预训练带来了更优的优化动态。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。