[论文解读] Improving Low-Resource Speech Recognition with Pretrained Speech Models: Continued Pretraining vs. Semi-Supervised Training
本文评估了在目标语言的未标注语音上对 XLSR-53 语音模型进行持续预训练(CoPT)作为低资源语音识别中半监督训练(SST)的替代方法。CoPT 在词错误率(WER)方面达到或优于 SST,计算效率更高;当结合使用 CoPT 生成的伪标签进行 SST 时,Georgian、Farsi、Somali 和 Tagalog 的 WER 进一步降低。
Self-supervised Transformer based models, such as wav2vec 2.0 and HuBERT, have produced significant improvements over existing approaches to automatic speech recognition (ASR). This is evident in the performance of the wav2vec 2.0 based pretrained XLSR-53 model across many languages when fine-tuned with available labeled data. However, the performance from finetuning these models can be dependent on the amount of in-language or similar-to-in-language data included in the pretraining dataset. In this paper we investigate continued pretraining (CoPT) with unlabeled in-language audio data on the XLSR-53 pretrained model in several low-resource languages. CoPT is more computationally efficient than semi-supervised training (SST), the standard approach of utilizing unlabeled data in ASR, since it omits the need for pseudo-labeling of the unlabeled data. We show CoPT results in word error rates (WERs), equal to or slightly better than using SST. In addition, we show that using the CoPT model for pseudo-labeling, and using these labels in SST, results in further improvements in WER.
研究动机与目标
- 探究在目标语言的未标注语音上进行持续预训练(CoPT)是否能提升低资源语音识别性能。
- 将 CoPT 与半监督训练(SST)进行比较,后者是利用未标注数据进行语音识别的标准方法。
- 评估 CoPT 与 SST 顺序使用时的互补性。
- 确定领域内与领域外未标注数据对 CoPT 效果的影响。
- 为多语言自监督模型(如 XLSR-53)应用 CoPT 制定最佳实践。
提出的方法
- 在 IARPA MATERIAL 计划和 BABEL 数据集提供的少量目标语言标注数据上微调 XLSR-53 模型。
- 使用 1,000 小时来自目标语言新闻频道的 YouTube 未标注语音对 XLSR-53 模型进行持续预训练(CoPT)。
- 使用基线 XLSR-53 模型生成伪标签用于 SST,并在标注数据与过滤后的伪标签数据组合上重新训练模型。
- 使用表现最佳的 CoPT 模型生成改进的伪标签用于 SST,然后在增强数据上重新训练模型。
- 在各语言特定的测试集上评估所有模型,包括按语体划分的测试集(电话通话、新闻、主题广播)。
- 在多个低资源语言上比较 CoPT、SST 以及混合 CoPT+SST 流程的 WER。
实验结果
研究问题
- RQ1与标准的半监督训练(SST)相比,在目标语言的未标注语音上进行持续预训练(CoPT)是否能提升低资源设置下的语音识别性能?
- RQ2在词错误率(WER)、计算成本和实现复杂度方面,CoPT 与 SST 的性能表现如何比较?
- RQ3CoPT 与 SST 是否可以联合使用以在低资源语音识别中实现进一步的性能提升?
- RQ4CoPT 数据与目标数据之间的领域一致性(例如,广播新闻与对话语音)是否会影响模型性能?
- RQ5即使使用领域外数据(如使用广播新闻音频提升对话语音识别性能),CoPT 是否依然有效?
主要发现
- 在所有评估的低资源语言(Georgian、Farsi、Somali 和 Tagalog)中,CoPT 实现的词错误率(WER)等于或优于半监督训练(SST)。
- 对于 Georgian,CoPT 将 WER 从基线的 33.8 降低至 MATERIAL 分析集上的 32.7,与 SST 结合后进一步改善。
- 对于 Farsi,CoPT 将 WER 从 41.5 降低至 38.2,混合 CoPT+SST 方法进一步降低至 37.4,表明两者具有显著协同效应。
- 在 BABEL 开发集上,CoPT 将 Georgian 的 WER 从 31.9 降低至 30.7,Tagalog 从 36.3 降低至 35.2,尽管 YouTube 数据与对话语音相比属于领域外数据。
- CoPT 带来的最大 WER 改进出现在新闻广播(NB)和主题广播(TB)语体中,这些语体在风格和内容上与 YouTube 语音更为相似。
- 使用 CoPT 生成的伪标签用于 SST 可带来额外改进,尤其在 Farsi 和 Tagalog 上表现明显,证明 CoPT 与 SST 具有互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。