Skip to main content
QUICK REVIEW

[论文解读] Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation

Fengpeng Yue, Yan Deng|arXiv (Cornell University)|Apr 8, 2021
Speech Recognition and Synthesis参考文献 35被引用 4
一句话总结

本文提出了一种机器语音链框架,通过 TTS→ASR 联合训练,仅使用目标领域文本数据实现领域和少样本语音风格适应。通过从目标领域文本生成合成语音并利用 ASR 反馈,该方法在端到端 ASR 中实现了 10% 的相对 WER 降低,在 TED-LIUM 上 TTS 生成语音中实现了 51.5% 的相对 WER 降低,通过少样本语音风格适应额外获得 2.6% 的相对 WER 改进。

ABSTRACT

Machine Speech Chain, which integrates both end-to-end (E2E) automatic speech recognition (ASR) and text-to-speech (TTS) into one circle for joint training, has been proven to be effective in data augmentation by leveraging large amounts of unpaired data. In this paper, we explore the TTS->ASR pipeline in speech chain to do domain adaptation for both neural TTS and E2E ASR models, with only text data from target domain. We conduct experiments by adapting from audiobook domain (LibriSpeech) to presentation domain (TED-LIUM), there is a relative word error rate (WER) reduction of 10% for the E2E ASR model on the TED-LIUM test set, and a relative WER reduction of 51.5% in synthetic speech generated by neural TTS in the presentation domain. Further, we apply few-shot speaker adaptation for the E2E ASR by using a few utterances from target speakers in an unsupervised way, results in additional gains.

研究动机与目标

  • 为解决端到端 ASR 和神经 TTS 中的文本领域和语音风格可变性不匹配问题,提出一种联合学习框架。
  • 在无需目标领域配对语音-文本数据的情况下,实现 ASR 和 TTS 的领域适应。
  • 通过利用 TTS 生成的合成语音和 ASR 反馈,探索无监督少样本语音风格适应。
  • 评估机器语音链在提升对域外文本和未见语音风格的鲁棒性和性能方面的有效性。

提出的方法

  • 该方法在机器语音链中采用 TTS→ASR 流水线,其中 TTS 从目标领域文本生成合成语音,ASR 通过交叉熵损失提供反馈以改进两个模型。
  • 联合训练通过在合成语音上使用 ASR 损失来更新 ASR 和 TTS 模型,使模型能够学习目标领域的声学和语言表征。
  • 对于领域适应,使用目标领域(TED-LIUM)的文本微调 TTS 模型,ASR 模型则在生成的合成语音上进行训练,从而减少领域不匹配。
  • 对于少样本语音风格适应,使用目标语音风格的少量参考语音片段来调节 TTS 模型,使其生成特定语音风格的合成语音,用于 ASR 的微调。
  • 该框架采用基于注意力机制的端到端 ASR 和基于 Tacotron2 的 TTS,结合引导注意力和交叉熵损失以提升训练稳定性和性能。
  • 训练策略包括联合优化两个模型,以及仅微调 ASR 而保持 TTS 固定,以评估对性能和鲁棒性的影响。

实验结果

研究问题

  • RQ1在仅使用目标领域文本的情况下,机器语音链中的 TTS→ASR 流水线能否有效减少 ASR 和 TTS 中的领域不匹配?
  • RQ2TTS 和 ASR 的联合训练在多大程度上能提升神经 TTS 对域外文本的鲁棒性并减少注意力错误?
  • RQ3在语音链框架中,通过合成语音生成和 ASR 反馈,无监督少样本语音风格适应能达到何种程度?
  • RQ4使用目标领域合成数据进行联合训练,是否能在不降低源领域性能的前提下提升 ASR 在真实目标领域测试集上的表现?

主要发现

  • 所提出的领域适应方法在 TED-LIUM 测试集上使端到端 ASR 的 WER 相对降低了 10%,从 25.9% 降至 23.3%。
  • 神经 TTS 在从目标领域文本生成的合成语音中实现了 51.5% 的相对 WER 降低,表明注意力鲁棒性显著提升。
  • TTS 在源领域(LibriSpeech)上的性能也相对提升了 16.9% 的 WER,表明联合训练具有良好的泛化能力。
  • 仅使用一个参考语音片段进行语音风格适应,使 ASR 的 WER 相对降低了 2.6%,当使用五个参考语音时性能进一步提升。
  • 联合训练 ASR 和 TTS 能获得更好的 TTS 鲁棒性,而仅微调 ASR 则带来略高的 ASR 性能,表明模型改进之间存在权衡。
  • 可视化分析证实,联合训练后 Tacotron2 的注意力对齐得到改善,尤其在域外文本上,验证了注意力错误的减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。