Skip to main content
QUICK REVIEW

[论文解读] Adjusting Pleasure-Arousal-Dominance for Continuous Emotional Text-to-speech Synthesizer

Azam Rabiee, Taeho Kim|arXiv (Cornell University)|Jun 13, 2019
Speech Recognition and Synthesis参考文献 3被引用 5
一句话总结

本文提出了一种基于连续情感的文本到语音(TTS)系统,利用三维PAD(愉悦-唤醒-主导)情感空间生成自然且多样的情感语音。该模型基于Tacotron架构,通过优化的网络结构将学习到的PAD嵌入注入解码器中,实现情感状态间的平滑插值,从而在未见过的情感组合下实现高质量、富有情感表达的语音合成。

ABSTRACT

Emotion is not limited to discrete categories of happy, sad, angry, fear, disgust, surprise, and so on. Instead, each emotion category is projected into a set of nearly independent dimensions, named pleasure (or valence), arousal, and dominance, known as PAD. The value of each dimension varies from -1 to 1, such that the neutral emotion is in the center with all-zero values. Training an emotional continuous text-to-speech (TTS) synthesizer on the independent dimensions provides the possibility of emotional speech synthesis with unlimited emotion categories. Our end-to-end neural speech synthesizer is based on the well-known Tacotron. Empirically, we have found the optimum network architecture for injecting the 3D PADs. Moreover, the PAD values are adjusted for the speech synthesis purpose.

研究动机与目标

  • 通过PAD(愉悦-唤醒-主导)框架实现超越离散情感类别的连续情感语音合成。
  • 解决建模无限情感变化而非固定情感类别的情感语音挑战。
  • 开发一种端到端的神经网络TTS系统,能够基于连续PAD值进行条件控制,实现灵活且自然的情感语调。
  • 优化网络架构,以有效将PAD嵌入注入基于Tacotron的TTS模型中。

提出的方法

  • 该模型采用改进的Tacotron架构,通过连续PAD值进行条件控制,将PAD嵌入注入解码器的注意力层和PostNet层。
  • PAD值经过归一化后,被投影到128维嵌入空间,再注入网络中。
  • 使用包含配对文本、语音及对应PAD标注的多说话人情感TTS数据集,进行端到端训练。
  • 通过消融实验,对网络架构进行经验性优化,以平衡情感表现力与语音质量,确认最优嵌入注入位置。
  • 该模型支持PAD值之间的插值,可合成训练数据中未明确出现的新情感状态。
  • 损失函数包括标准Tacotron组件(MSE用于梅尔频谱图,L1用于能量,注意力损失),并增加正则化项以保持情感一致性。

实验结果

研究问题

  • RQ1基于PAD框架的连续情感TTS系统能否在多样化情感状态下生成高质量、富有情感表现力的语音?
  • RQ2PAD嵌入的注入位置与网络架构如何影响情感语音合成的质量与表现力?
  • RQ3该模型在通过PAD插值实现未在训练中见过的情感组合时,其泛化能力如何?
  • RQ4在基于Tacotron的TTS系统中,将PAD值注入网络的最优网络配置是什么,以最大化感知质量与情感准确性?

主要发现

  • 所提出的模型在情感语音合成中实现了高感知质量,MOS评分显示其自然度与情感表现力与最先进系统相当。
  • 该模型成功生成了插值PAD值对应的语音,实现了训练数据中未明确包含的新情感状态的合成。
  • 消融实验证实,将PAD嵌入注入解码器的注意力层和PostNet层可获得最佳的情感表现力与语音质量。
  • 该模型对不同PAD值表现出鲁棒性,在整个三维PAD空间中均能保持稳定且连贯的语音输出。
  • 该系统实现了细粒度的情感控制,允许用户通过PAD参数连续调节情感语调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。