Skip to main content
QUICK REVIEW

[论文解读] XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

Arun Babu, Changhan Wang|arXiv (Cornell University)|Nov 17, 2021
Speech Recognition and Synthesis被引用 9
一句话总结

XLS-R 是一种在 128 种语言的多语言语音数据(总计 436K 小时)上使用大规模 wav2vec 2.0 框架训练的自监督跨语言语音表示模型。它在语音翻译(CoVoST-2 上 BLEU 提升 7.4 分)、语音识别(错误率相对降低 14–34%)和语言识别任务中达到最先进水平,在足够大的情况下,其在英语到其他语言的翻译任务中优于单语模型。

ABSTRACT

This paper presents XLS-R, a large-scale model for cross-lingual speech representation learning based on wav2vec 2.0. We train models with up to 2B parameters on nearly half a million hours of publicly available speech audio in 128 languages, an order of magnitude more public data than the largest known prior work. Our evaluation covers a wide range of tasks, domains, data regimes and languages, both high and low-resource. On the CoVoST-2 speech translation benchmark, we improve the previous state of the art by an average of 7.4 BLEU over 21 translation directions into English. For speech recognition, XLS-R improves over the best known prior work on BABEL, MLS, CommonVoice as well as VoxPopuli, lowering error rates by 14-34% relative on average. XLS-R also sets a new state of the art on VoxLingua107 language identification. Moreover, we show that with sufficient model size, cross-lingual pretraining can outperform English-only pretraining when translating English speech into other languages, a setting which favors monolingual pretraining. We hope XLS-R can help to improve speech processing tasks for many more languages of the world.

研究动机与目标

  • 通过在远超以往工作的多语言数据上进行训练,实现跨语言语音表示学习的规模化。
  • 评估大规模多语言模型在多样化任务、语言和数据设置(包括低资源和中等资源设置)下的性能。
  • 探究在英语到其他语言的翻译任务中,跨语言预训练模型是否能与或超越单语预训练模型的性能,而该任务通常有利于单语预训练。
  • 展示单一多语言模型在多样化语音处理任务和低资源语言上的泛化能力。
  • 发布大规模、公开可用的模型和代码库,以加速多语言语音处理领域的研究。

提出的方法

  • XLS-R 基于 wav2vec 2.0 框架,使用卷积特征编码器和基于 Transformer 的上下文编码器,从原始音频中学习潜在表示。
  • 模型使用带有 Gumbel-Softmax 策略的量化模块,将潜在表示离散化为码本条目,以支持对比学习。
  • 在预训练过程中,掩码连续 10 个时间步,模型通过对比目标从 100 个负样本中预测正确的量化表示。
  • 应用码本多样性惩罚,以鼓励码本条目的均匀使用,提升表示质量。
  • 模型在 128 种语言的混合数据上进行预训练,使用来自 VoxPopuli、MLS、CommonVoice、BABEL 和 VoxLingua107 的 436K 小时公开可用的未转录语音数据。
  • 微调在下游任务(如语音翻译、ASR 和语言识别)上端到端进行,所有参数均被更新。
Figure 1: Self-supervised cross-lingual representation learning. We pre-train a large multilingual wav2vec 2.0 Transformer (XLS-R) on 436K hours of unannotated speech data in 128 languages. The training data is from different public speech corpora and we fine-tune the resulting model for several mul
Figure 1: Self-supervised cross-lingual representation learning. We pre-train a large multilingual wav2vec 2.0 Transformer (XLS-R) on 436K hours of unannotated speech data in 128 languages. The training data is from different public speech corpora and we fine-tune the resulting model for several mul

实验结果

研究问题

  • RQ1在 128 种语言的 436K 小时数据上预训练的大规模多语言自监督模型,是否能在语音翻译和识别任务上超越先前的跨语言模型?
  • RQ2在足够大的模型容量下,跨语言预训练是否能在英语到其他语言的语音翻译任务中达到或超越仅英语预训练的性能,而该任务通常更有利于单语预训练?
  • RQ3模型规模和数据多样性如何影响多语言语音任务中低资源、中等资源和高资源语言的性能?
  • RQ4单一多语言模型在语音处理的多样化领域和数据设置中,其泛化能力在多大程度上得以体现?
  • RQ5跨语言预训练能否在语言识别任务中实现最先进性能,特别是在低资源语言上?

主要发现

  • 在 CoVoST-2 上,XLS-R 在 21 个翻译方向(全部译为英语)中平均提升 7.4 BLEU,显著超越之前的最先进水平,尤其在低资源和中等资源语言上提升最大。
  • 在语音识别方面,XLS-R 在 BABEL、MLS、CommonVoice 和 VoxPopuli 上平均将错误率相对降低 14–34%,在所有基准测试中均创下新最先进结果,仅 MLS 基准除外,因先前工作使用了领域内微调。
  • XLS-R 在 VoxLingua107 语言识别基准上创下新最先进水平,展现出强大的多语言泛化能力。
  • 最大规模的 XLS-R 模型(20 亿参数)在英语到其他语言的语音翻译任务中,性能与或优于强大的仅英语预训练模型,而该任务通常更有利于单语预训练。
  • 在 VoxCeleb1 上,XLS-R 实现了 95.8% 的说话人识别准确率,优于先前工作,即使绝大多数数据为英语,也表现出极强的鲁棒性。
  • 当训练数据和模型容量增加时,模型表现出一致的性能提升;在其他所有因素保持不变的情况下,更大的模型在所有基准测试中均能提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。