Skip to main content
QUICK REVIEW

[论文解读] Leveraging Weakly Supervised Data to Improve End-to-End Speech-to-Text Translation

Jia Ye, Melvin Johnson|arXiv (Cornell University)|Nov 5, 2018
Natural Language Processing Techniques参考文献 30被引用 14
一句话总结

本文提出了一种弱监督学习方法,通过利用从预训练的ASR、MT和TTS模型生成的合成数据,提升了端到端语音到文本翻译的性能。通过在高质量的合成语音到翻译样本对上微调预训练的序列到序列ST模型——尤其是使用多说话人TTS生成的数据——性能超越了多任务学习,甚至仅使用弱监督来源的合成数据即可取得优异结果。

ABSTRACT

End-to-end Speech Translation (ST) models have many potential advantages when compared to the cascade of Automatic Speech Recognition (ASR) and text Machine Translation (MT) models, including lowered inference latency and the avoidance of error compounding. However, the quality of end-to-end ST is often limited by a paucity of training data, since it is difficult to collect large parallel corpora of speech and translated transcript pairs. Previous studies have proposed the use of pre-trained components and multi-task learning in order to benefit from weakly supervised training data, such as speech-to-transcript or text-to-foreign-text pairs. In this paper, we demonstrate that using pre-trained MT or text-to-speech (TTS) synthesis models to convert weakly supervised data into speech-to-translation pairs for ST training can be more effective than multi-task learning. Furthermore, we demonstrate that a high quality end-to-end ST model can be trained using only weakly supervised datasets, and that synthetic data sourced from unlabeled monolingual text or speech can be used to improve performance. Finally, we discuss methods for avoiding overfitting to synthetic speech with a quantitative ablation study.

研究动机与目标

  • 解决端到端语音翻译中大规模平行语音到翻译数据集稀缺的问题。
  • 通过利用语音到转录或文本到翻译等弱监督数据提升模型性能。
  • 探究利用预训练组件生成的合成数据是否能在端到端ST中超越多任务学习。
  • 研究仅使用无标签单语文本或语音生成的合成数据训练高质量ST模型的可行性。
  • 通过仔细的训练策略(包括冻结预训练编码器)缓解对合成语音的过拟合。

提出的方法

  • 使用大规模弱监督数据,分别在ASR任务上预训练ST模型的编码器,在MT任务上预训练解码器。
  • 通过高质量多说话人TTS模型将MT数据集中的文本转换为语音,生成合成的语音到翻译样本对。
  • 在真实平行数据与合成语音到翻译样本对的组合上微调端到端ST模型。
  • 在微调过程中冻结预训练编码器,以防止对合成语音的过拟合,尤其是在使用单说话人TTS时。
  • 通过级联的ASR和MT系统或TTS,利用无标签单语文本或语音合成平行数据,并用于额外的预训练或微调。
  • 应用数据增强技术,并使用Griffin-Lim声码器以确保真实数据与合成数据之间音频质量的一致性。

实验结果

研究问题

  • RQ1与多任务学习相比,利用预训练MT和TTS模型生成的合成数据是否能显著提升端到端语音翻译性能?
  • RQ2使用高质量多说话人TTS进行数据合成是否比单说话人TTS带来更好的泛化性能?
  • RQ3能否在不使用任何完全监督的平行数据的情况下,仅依赖弱监督来源生成的合成数据训练出高质量的端到端ST模型?
  • RQ4当与少量真实平行数据结合时,从无标签单语文本或语音中衍生的合成数据在提升ST性能方面的有效性如何?
  • RQ5哪些训练策略(如冻结预训练组件)在防止对合成语音输入的过拟合方面最为有效?

主要发现

  • 在多说话人TTS生成的合成数据上进行微调,性能超越了多任务学习,在域内测试集上达到55.9的BLEU分数,在域外测试集上达到19.4的BLEU分数。
  • 使用从无标签单语文本生成的合成数据,将基线模型的BLEU分数从域内49.1提升至55.9,域外从12.1提升至19.4。
  • 从无标签单语语音生成的合成数据使基线模型的BLEU分数提升至域内52.4和域外15.3,但效果不如基于文本的合成方法。
  • 结合文本和语音来源的合成数据,BLEU分数达到域内55.8和域外16.9,表明两种方法具有互补优势。
  • 使用单说话人TTS生成的合成数据进行微调,导致域外测试集性能显著下降,凸显了合成数据中韵律质量的重要性。
  • 在合成数据上微调时冻结预训练编码器对防止过拟合至关重要,尤其是在使用低质量TTS系统时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。