Skip to main content
QUICK REVIEW

[论文解读] Simple and Effective Zero-shot Cross-lingual Phoneme Recognition

Qiantong Xu, Alexei Baevski|arXiv (Cornell University)|Sep 23, 2021
Speech Recognition and Synthesis参考文献 35被引用 10
一句话总结

该论文提出了一种简单而有效的零样本跨语言音素识别方法,通过在多种训练语言的标注数据上微调多语言预训练的wav2vec 2.0模型(XLSR-53),并利用发音特征将音素映射到未见的目标语言。该方法通过充分利用完整的模型微调和跨语言预训练,显著优于先前工作,在仅使用少量标注数据的情况下,于42个CommonVoice、19个BABEL和6个MLS语言上取得了最先进性能。

ABSTRACT

Recent progress in self-training, self-supervised pretraining and unsupervised learning enabled well performing speech recognition systems without any labeled data. However, in many cases there is labeled data available for related languages which is not utilized by these methods. This paper extends previous work on zero-shot cross-lingual transfer learning by fine-tuning a multilingually pretrained wav2vec 2.0 model to transcribe unseen languages. This is done by mapping phonemes of the training languages to the target language using articulatory features. Experiments show that this simple method significantly outperforms prior work which introduced task-specific architectures and used only part of a monolingually pretrained model.

研究动机与目标

  • 通过在不同语言之间实现零样本迁移学习,解决低资源语言在语音识别中缺乏标注数据的问题。
  • 通过利用多语言自监督预训练而非单语言或任务特定架构,改进零样本跨语言音素识别。
  • 通过训练一个单一的多语言模型以减少对语言特定模型的依赖,该模型能够转录未见过的语言。
  • 通过完整微调多语言模型并利用发音特征进行有效的音素映射,提升零样本性能。

提出的方法

  • 在多种训练语言的标注数据上微调一个经过多语言预训练的XLSR-53 wav2vec 2.0模型,以执行音素识别。
  • 使用发音特征(21个属性:主要类别、方式、部位、喉部)计算音素之间的汉明距离,以实现跨语言映射。
  • 构建两种词典类型:tr2tgt(将训练音素映射到最近的目标音素)和tgt2tr(将目标音素映射到最近的训练音素),用于解码。
  • 使用语言模型和构建的词典对微调后的模型进行解码,生成未见语言的最终音素序列。
  • 在掩码潜在表征上使用对比学习目标进行模型训练,并通过Gumbel-Softmax对53种语言进行量化。
  • 使用音素化工具(eSpeak、Phonetisaurus)生成语音转写,并通过音素标记错误率(PTER)评估性能。

实验结果

研究问题

  • RQ1多语言预训练的wav2vec 2.0模型是否能在零样本跨语言音素识别中优于仅在单语言预训练上微调的模型?
  • RQ2与仅微调特征提取器相比,完整微调整个模型是否能在零样本设置中带来显著性能提升?
  • RQ3基于发音特征的音素映射在推理过程中处理未登录词音素时是否有效?
  • RQ4在多种语言的零样本跨语言音素识别中,多语言预训练与单语言预训练相比表现如何?

主要发现

  • 所提方法优于仅使用单语言预训练wav2vec 2.0模型特征提取器的先前工作,在CommonVoice上平均PTER达到22.2%,仅使用149小时总标注数据。
  • 多语言预训练(XLSR-53)将CommonVoice上的平均PTER降低至22.2%,而单语言预训练(w2v LV-60K)为46.5%,证明了跨语言表征的优越性。
  • 仅在6个BABEL语言(317小时)上微调完整XLSR-53模型,性能优于先前方法在近1,500小时数据上训练的结果,显示出显著的效率优势。
  • tr2tgt词典构建策略的性能略优(平均PTER为24.5%),优于tgt2tr(24.6%),两者均优于eSpeak和Phonetisaurus等音素化工具(分别为31.7%和32.4%)。
  • 该模型在与无监督语音识别方法相比表现具有竞争力,能够使用单一统一模型转录多种未见语言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。