Skip to main content
QUICK REVIEW

[论文解读] VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation

Changhan Wang, Morgane Rivière|arXiv (Cornell University)|Jan 2, 2021
Natural Language Processing Techniques被引用 5
一句话总结

VoxPopuli 引入了一个大规模多语言语音语料库,包含跨23种语言的40万小时未标注语音,以及1.8千小时的转录语音,其中包含17.3千小时在15对语言间的对齐口语翻译。该语料库显著提升了半监督自动语音识别(ASR)与语音到文本翻译的性能,尤其在分布外设置下表现突出,展示了其在表征学习与翻译建模方面的强大可迁移性与实用性。

ABSTRACT

We introduce VoxPopuli, a large-scale multilingual corpus providing 100K hours of unlabelled speech data in 23 languages. It is the largest open data to date for unsupervised representation learning as well as semi-supervised learning. VoxPopuli also contains 1.8K hours of transcribed speeches in 16 languages and their aligned oral interpretations into 5 other languages totaling 5.1K hours. We provide speech recognition baselines and validate the versatility of VoxPopuli unlabelled data in semi-supervised learning under challenging out-of-domain settings. We will release the corpus at https://github.com/facebookresearch/voxpopuli under an open license.

研究动机与目标

  • 解决在英语等高资源语言之外,大规模、开放的多语言语音数据在无监督与半监督学习中的缺乏问题。
  • 提供一个全面的多语言语音语料库,包含对齐的口语翻译,以建模同步翻译策略。
  • 通过提供多样化、真实世界的语音数据,推动低资源语言及分布外语音到文本与语音到语音翻译的研究。
  • 通过提供大量未标注与弱标注数据,支持鲁棒的自监督与弱监督模型的开发。
  • 通过包含自然发生的口语翻译,促进对翻译特异性语音模式的研究,此类翻译与书面翻译截然不同。

提出的方法

  • 从2009年至2020年欧洲议会全体会议与委员会会议中收集原始音频、转录文本与时间戳。
  • 构建自动化处理流程,将语音分割为话语单元,将转录文本对齐至音频,并过滤掉错误或不完整的片段。
  • 利用语音到语音对齐,通过口语翻译生成弱监督训练数据,用于语音到文本翻译。
  • 在分布外测试集上,利用未标注数据进行自训练,以提升ASR与语音翻译模型的性能。
  • 在联合训练中结合已标注与弱标注数据,以增强模型的泛化能力与性能。
  • 通过在域内(EP)与分布外(Common Voice)基准上的评估,测试模型的可迁移性与鲁棒性。

实验结果

研究问题

  • RQ1大规模未标注多语言语音数据是否能提升多种低资源语言在半监督ASR与语音翻译中的性能?
  • RQ2与标准监督方法或伪标签方法相比,利用对齐口语翻译进行弱监督训练,在多大程度上能提升语音到文本翻译的质量?
  • RQ3在VoxPopuli数据上进行自训练,在多大程度上能提升模型在分布外测试集上的泛化能力?
  • RQ4在端到端模型中,是否可以通过引入口语翻译(与书面翻译不同)来更好地建模同步性与翻译策略?
  • RQ5在低资源设置下,结合已标注与弱标注数据是否能优于单独使用任一类型数据?

主要发现

  • 在VoxPopuli的40万小时未标注数据上进行自训练,显著提升了域内(EP)与分布外(CV)的ASR性能,且在多种语言中均实现了稳定增益。
  • 利用0.4千小时对齐口语翻译进行弱监督训练,其性能达到或优于使用0.3倍至1.8倍更多数据的监督基线,表明极高的数据效率。
  • 结合已标注与弱标注数据的联合训练优于自训练与监督基线,表明弱标注数据具有高度信息量且具有互补性。
  • 该语料库显著提升了语音到文本翻译的性能,尤其在无需额外标注数据的情况下,缩小了端到端模型与级联模型之间的性能差距。
  • VoxPopuli的未标注数据展现出强大的可迁移性,在Common Voice等分布外测试集上,即使对低资源语言也显著提升了性能。
  • 对齐处理流程产生了高质量的弱监督信号,表现为基于弱标注数据训练的模型性能强劲,间接验证了对齐流程的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。