[论文解读] Using previous acoustic context to improve Text-to-Speech synthesis
本文提出了一种上下文感知的文本转语音(TTS)模型,通过使用基于全局风格标记(Global Style Token)的声学上下文编码器(ACE),从先前话语中利用声学上下文来提升语音的自然度。该模型采用多任务损失进行训练,结合了标准Tacotron 2损失与一个回归任务,用于预测当前话语的嵌入表示,相较于标准Tacotron 2基线模型,在主观评估中显著提升了语音自然度。
Many speech synthesis datasets, especially those derived from audiobooks, naturally comprise sequences of utterances. Nevertheless, such data are commonly treated as individual, unordered utterances both when training a model and at inference time. This discards important prosodic phenomena above the utterance level. In this paper, we leverage the sequential nature of the data using an acoustic context encoder that produces an embedding of the previous utterance audio. This is input to the decoder in a Tacotron 2 model. The embedding is also used for a secondary task, providing additional supervision. We compare two secondary tasks: predicting the ordering of utterance pairs, and predicting the embedding of the current utterance audio. Results show that the relation between consecutive utterances is informative: our proposed model significantly improves naturalness over a Tacotron 2 baseline.
研究动机与目标
- 为解决将语音数据视为孤立话语所导致的局限性,避免在类似有声读物的独白中丢失长时序语调上下文。
- 通过利用前序语音的声学上下文,建模连续话语之间的语调依赖关系,从而提升TTS的自然度。
- 探究基于声学上下文的辅助任务训练是否能提升合成语音的泛化能力与语调真实感。
- 评估当合成语音在上下文中被聆听时,是否显得更加自然,特别是在连续段落中的表现。
提出的方法
- 采用基于全局风格标记(GST)的声学上下文编码器(ACE),将前一话语的音频嵌入为紧凑的表示。
- 在训练和推理过程中,将ACE嵌入作为额外的上下文向量注入Tacotron 2解码器。
- 采用多任务学习设置,结合标准Tacotron 2损失与一个辅助回归损失,以从先前话语预测当前话语的嵌入表示。
- 评估了两个辅助任务:预测当前话语嵌入(Next Task)与预测话语对的顺序(Pair Order)。
- 模型通过TTS损失与辅助任务损失之和进行端到端训练,使网络能够学习上下文化的语调模式。
- 在推理阶段,ACE利用前一合成话语的音频生成上下文嵌入,实现因果的、上下文感知的生成。
实验结果
研究问题
- RQ1建模前序话语的声学上下文是否能提升TTS生成语音的自然度?
- RQ2基于回归的辅助任务(从先前话语预测当前话语嵌入)是否比其他任务带来更优的语调建模效果?
- RQ3该模型在推理过程中在多大程度上真正利用了声学上下文,而非忽略它?
- RQ4当合成语音在上下文中被聆听时,是否显得更加自然,特别是在连续段落中?
主要发现
- 在主观评估中,所提模型相较于标准Tacotron 2基线模型显著提升了语音自然度,听者感知到更高的语音质量与更自然的语调。
- 在‘Next Task’模型中,通过从先前话语回归预测当前话语嵌入,其表现优于‘Pair Order’任务,并在自然度方面取得了最佳结果。
- 定性分析表明,使用正确声学上下文训练的模型能根据输入上下文生成多样的基频轨迹、时长与停顿,表明其在合成过程中积极利用了上下文信息。
- 相比之下,使用随机(无关)上下文训练的模型无论输入如何,输出均相同,证实‘Next Task’模型真正学会了有意义地利用所提供的上下文。
- 结果表明,通过声学上下文建模长时序语调模式,不仅能提升孤立话语的质量,还能增强序列语音中的上下文自然度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。