[论文解读] Unsupervised Cross-lingual Representation Learning for Speech Recognition
该论文提出 XLSR,一种在 53 种语言的原始音频上使用量化潜在语音单元的对比学习目标进行预训练的多语言语音表征模型。通过联合学习跨语言的共享离散表征,XLSR 实现了最先进性能,在 CommonVoice 上将相对音素错误率降低 72%,在 BABEL 上将词错误率降低 16%,且在低资源语言上取得更强提升。
This paper presents XLSR which learns cross-lingual speech representations by pretraining a single model from the raw waveform of speech in multiple languages. We build on wav2vec 2.0 which is trained by solving a contrastive task over masked latent speech representations and jointly learns a quantization of the latents shared across languages. The resulting model is fine-tuned on labeled data and experiments show that cross-lingual pretraining significantly outperforms monolingual pretraining. On the CommonVoice benchmark, XLSR shows a relative phoneme error rate reduction of 72% compared to the best known results. On BABEL, our approach improves word error rate by 16% relative compared to a comparable system. Our approach enables a single multilingual speech recognition model which is competitive to strong individual models. Analysis shows that the latent discrete speech representations are shared across languages with increased sharing for related languages. We hope to catalyze research in low-resource speech understanding by releasing XLSR-53, a large model pretrained in 53 languages.
研究动机与目标
- 开发一个单一的多语言语音识别模型,使其在预训练阶段无需标注数据即可在多种语言间泛化。
- 探究在原始音频上进行无监督跨语言预训练是否能提升性能,尤其是对低资源语言而言。
- 分析共享离散潜在表征在不同语言间的分布情况,以及语言之间的相似性是否影响迁移性能。
- 证明在多个语言上微调单一 XLSR 模型,可获得与分别微调各模型相当的性能。
提出的方法
- 使用 wav2vec 2.0 的对比学习目标,在多个语言的原始音频上预训练单一模型,针对掩码后的潜在表征。
- 使用共享量化模块(G=2 个码本,每个 V=320 个条目)生成跨语言共享的离散语音单元。
- 应用 Gumbel-Softmax 平滑化方法,以实现离散码本选择的端到端可微训练。
- 在下游语音识别任务上微调完整的基于 Transformer 的模型,而非冻结特征或将其作为独立分类器的输入。
- 在 CommonVoice(10 种语言,朗读语音)和 BABEL(14 种语言,对话式电话语音)基准上进行评估。
- 通过归一化标记频率分布的 Jensen-Shannon 散度计算语言相似性,随后进行 K-Means 聚类和主成分分析(PCA)。
实验结果
研究问题
- RQ1仅使用原始、未标注音频对多种语言进行预训练,是否能提升语音识别性能,相比单语言预训练?
- RQ2在无标注数据条件下,语言相似性如何影响跨语言迁移性能?
- RQ3离散潜在语音表征在多大程度上被不同语言共享?相关语言是否共享更多标记?
- RQ4在多个语言上微调单一多语言模型,是否能获得与分别训练模型相当的性能?
- RQ5所学习的离散表征在多大程度上反映了语言之间的语言学关系?
主要发现
- 与最佳先前结果相比,XLSR 在 CommonVoice 上实现了 72% 的相对音素错误率降低,表明多语言预训练带来了显著提升。
- 在 BABEL 基准上,XLSR 相较于类似系统,将词错误率相对降低了 16%,显示出强大的跨语言迁移能力。
- 对于低资源语言(如意大利语),使用相关语言(如西班牙语)的 50 小时未标注数据进行预训练,可获得最大性能提升,错误率最高降低 16.8%。
- 该模型在语言上相近的语言(如西班牙语、意大利语和巴斯克语)之间共享更多离散潜在单元,表明语言亲缘性增强了表征共享。
- 像中文-香港(zh-HK)这样的语言与其他语言的标记共享极少,表明其在共享表征空间中具有高度隔离性。
- 同时在多个语言上微调单一 XLSR 模型,可生成性能与分别微调模型相当的多语言自动语音识别系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。