Skip to main content
QUICK REVIEW

[论文解读] Speaking style adaptation in Text-To-Speech synthesis using Sequence-to-sequence models with attention

Bajibabu Bollepalli, Lauri Juvela|arXiv (Cornell University)|Oct 29, 2018
Speech Recognition and Synthesis参考文献 27被引用 4
一句话总结

本文提出一种迁移学习方法,将基于正常语音训练的序列到序列文本转语音(TTS)模型,通过仅30分钟的伦巴德语音数据微调,适配为生成高质量伦巴德风格语音。通过使用基于梅尔倒谱图的WaveNet声码器,该系统在风格相似性和自然度方面显著优于基线方法,主观评价中达到合成伦巴德语音质量的最先进水平。

ABSTRACT

Currently, there are increasing interests in text-to-speech (TTS) synthesis to use sequence-to-sequence models with attention. These models are end-to-end meaning that they learn both co-articulation and duration properties directly from text and speech. Since these models are entirely data-driven, they need large amounts of data to generate synthetic speech with good quality. However, in challenging speaking styles, such as Lombard speech, it is difficult to record sufficiently large speech corpora. Therefore, in this study we propose a transfer learning method to adapt a sequence-to-sequence based TTS system of normal speaking style to Lombard style. Moreover, we experiment with a WaveNet vocoder in synthesis of Lombard speech. We conducted subjective evaluations to assess the performance of the adapted TTS systems. The subjective evaluation results indicated that an adaptation system with the WaveNet vocoder clearly outperformed the conventional deep neural network based TTS system in synthesis of Lombard speech.

研究动机与目标

  • 解决端到端TTS系统训练中高质量伦巴德语音数据稀缺的挑战。
  • 通过使TTS系统能够合成伦巴德风格语音,提升嘈杂环境下的语音可懂度。
  • 探究迁移学习是否能有效利用极少的目标领域数据,将正常风格TTS模型适配为伦巴德风格。
  • 评估不同声码器(尤其是WaveNet)对适配后伦巴德语音质量与自然度的影响。

提出的方法

  • 仅使用30分钟伦巴德语音数据,对预训练的序列到序列TTS模型(基于Tacotron)进行微调。
  • 将WaveNet声码器基于序列到序列模型输出提取的梅尔倒谱图进行条件控制,以生成原始波形。
  • 利用迁移学习微调模型的注意力机制和解码器层,使其学习伦巴德语音特有的语调特征,如基频提升和嗓音强度增强。
  • 采用说话人条件控制,在保持说话人身份的同时适配说话风格。
  • 对LSTM和基于Transformer的编码器-解码器架构分别进行微调,以比较性能差异。
  • 采用多阶段训练流程:先在正常语音上预训练TTS模型,再将其适配为伦巴德风格。

实验结果

研究问题

  • RQ1能否仅用极少的目标领域数据,有效将基于正常语音训练的序列到序列TTS模型适配为生成高质量伦巴德风格语音?
  • RQ2声码器的选择(特别是WaveNet与传统World声码器)如何影响合成伦巴德语音的自然度与风格准确性?
  • RQ3将WaveNet声码器基于梅尔倒谱图进行条件控制,是否能提升适配后伦巴德语音的质量,相比端到端的WaveNet训练?
  • RQ4与现有基于LSTM的TTS系统相比,适配后系统的风格相似性与自然度表现如何?
  • RQ5在低资源环境下,模型架构(LSTM与Transformer)对风格适配有效性的影响力如何?

主要发现

  • S5系统(使用基于梅尔倒谱图条件控制的WaveNet声码器)在风格相似性评分中最高,表明其最接近自然伦巴德语音的声学特征。
  • 在自然度的CCR测试中,基于WaveNet的系统(S5)显著优于基线系统(S1),平均自然度评分具有统计学显著性提升。
  • 使用WaveNet声码器的系统在风格相似性和自然度评估中,得分始终高于使用World声码器的系统。
  • 该适配方法仅用30分钟目标领域数据,成功生成了类似伦巴德风格的语音,证明了迁移学习在低资源场景下的有效性。
  • 基于Transformer的模型搭配WaveNet声码器(S5)在主观听音测试中整体表现最佳,优于基于LSTM的系统和基线系统。
  • 结果证实,将WaveNet声码器基于梅尔倒谱图进行条件控制,可显著提升合成伦巴德语音的质量,即使训练数据有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。