Skip to main content
QUICK REVIEW

[论文解读] ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversion

Edresson Casanova, Christopher Shulby|arXiv (Cornell University)|Mar 29, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出了一种新颖的自动语音识别(ASR)数据增强方法,结合跨语言多说话人TTS与跨语言语音转换,仅需一个目标语言的真实说话人即可有效训练ASR模型。该方法在葡萄牙语(pt-BR)和俄语(ru-RU)上分别实现了33.96%和36.59%的WER降低,表明高质量合成数据可与在大规模真人语音数据集上训练的模型相媲美。

ABSTRACT

We explore cross-lingual multi-speaker speech synthesis and cross-lingual voice conversion applied to data augmentation for automatic speech recognition (ASR) systems in low/medium-resource scenarios. Through extensive experiments, we show that our approach permits the application of speech synthesis and voice conversion to improve ASR systems using only one target-language speaker during model training. We also managed to close the gap between ASR models trained with synthesized versus human speech compared to other works that use many speakers. Finally, we show that it is possible to obtain promising ASR training results with our data augmentation method using only a single real speaker in a target language.

研究动机与目标

  • 解决在缺乏多说话人数据集或难以收集此类数据的低资源环境下训练高效ASR系统的问题。
  • 探究仅使用一个目标语言的真实说话人是否足以通过合成数据增强训练出具有竞争力的ASR模型。
  • 探索利用跨语言多说话人TTS与零样本语音转换生成多样化、逼真的ASR训练数据的可行性。
  • 缩小在低资源场景下,基于合成数据与真人语音训练的ASR模型之间的性能差距。
  • 实现对濒危语言或资源匮乏语言的ASR系统实用化部署,且数据需求极低。

提出的方法

  • 使用预训练的跨语言多说话人TTS模型(YourTTS)从单一目标语言说话人的语音中生成合成语音。
  • 应用跨语言零样本语音转换,将合成语音转换为目标语言中1,248名英语说话人的语音,生成多样化的合成训练数据。
  • 仅在目标语言(pt-BR或ru-RU)的单一真实说话人语音上微调TTS模型,语音转换则以英语作为源语言。
  • 生成两个合成数据集:GEN_TTS(来自目标说话人的合成语音)和GEN_VC(转换为其他说话人语音的语音)。
  • 将GEN_TTS与GEN_VC数据与原始单说话人数据集结合,用于增强ASR训练数据。
  • 使用增强后的数据训练端到端ASR模型,并在Common Voice测试集上评估pt-BR与ru-RU的性能。
Figure 1: Full pipeline diagram for Baseline + DA experiment
Figure 1: Full pipeline diagram for Baseline + DA experiment

实验结果

研究问题

  • RQ1在仅使用一个目标语言说话人训练的TTS模型是否能生成改善ASR性能的合成语音,并通过语音转换实现性能提升?
  • RQ2在低资源环境下,是否仅使用一个真实目标语言说话人即可实现具有竞争力的ASR性能?
  • RQ3在低资源场景下,使用合成数据训练的ASR模型性能与使用真人语音训练的模型相比如何?
  • RQ4跨语言多说话人TTS与跨语言语音转换的结合是否优于现有的低资源ASR数据增强技术?
  • RQ5该方法在自监督预训练背景下,是否能泛化至已见语言(如葡萄牙语)与未见语言(如俄语)?

主要发现

  • 所提方法将WER从基线(仅使用一个真实说话人)的63.90%降低至葡萄牙语(pt-BR)的33.96%,相对提升达29.94%。
  • 对于俄语(ru-RU),WER从74.02%降至36.59%,相对提升达37.43%。
  • 使用合成数据(GEN_TTS + GEN_VC)训练的模型在ru-RU上的表现与SOTA系统相当,尽管仅使用了一个真实说话人。
  • 该方法在Wav2Vec 2.0预训练中包含的语言(pt-BR)和未包含的语言(ru-RU)中均取得良好结果,展现出良好的泛化能力。
  • 该方法显著缩小了基于合成数据与真人语音训练的ASR模型之间的性能差距,在pt-BR中实现33.96% WER,优于此前未使用自监督学习的SOTA结果。
  • 上界基准(Common Voice + TTS数据集)在pt-BR中实现20.39% WER,在ru-RU中实现24.80% WER,表明尽管所提方法具有竞争力,但仍与全量数据性能存在差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。