[论文解读] Adjusting Pleasure-Arousal-Dominance for Continuous Emotional Text-to-speech Synthesizer
本文提出了一种基于连续情感的文本到语音(TTS)系统,利用三维PAD(愉悦-唤醒-主导)情感空间生成自然且多样的情感语音。该模型基于Tacotron架构,通过优化的网络结构将学习到的PAD嵌入注入解码器中,实现情感状态间的平滑插值,从而在未见过的情感组合下实现高质量、富有情感表达的语音合成。
Emotion is not limited to discrete categories of happy, sad, angry, fear, disgust, surprise, and so on. Instead, each emotion category is projected into a set of nearly independent dimensions, named pleasure (or valence), arousal, and dominance, known as PAD. The value of each dimension varies from -1 to 1, such that the neutral emotion is in the center with all-zero values. Training an emotional continuous text-to-speech (TTS) synthesizer on the independent dimensions provides the possibility of emotional speech synthesis with unlimited emotion categories. Our end-to-end neural speech synthesizer is based on the well-known Tacotron. Empirically, we have found the optimum network architecture for injecting the 3D PADs. Moreover, the PAD values are adjusted for the speech synthesis purpose.
研究动机与目标
- 通过PAD(愉悦-唤醒-主导)框架实现超越离散情感类别的连续情感语音合成。
- 解决建模无限情感变化而非固定情感类别的情感语音挑战。
- 开发一种端到端的神经网络TTS系统,能够基于连续PAD值进行条件控制,实现灵活且自然的情感语调。
- 优化网络架构,以有效将PAD嵌入注入基于Tacotron的TTS模型中。
提出的方法
- 该模型采用改进的Tacotron架构,通过连续PAD值进行条件控制,将PAD嵌入注入解码器的注意力层和PostNet层。
- PAD值经过归一化后,被投影到128维嵌入空间,再注入网络中。
- 使用包含配对文本、语音及对应PAD标注的多说话人情感TTS数据集,进行端到端训练。
- 通过消融实验,对网络架构进行经验性优化,以平衡情感表现力与语音质量,确认最优嵌入注入位置。
- 该模型支持PAD值之间的插值,可合成训练数据中未明确出现的新情感状态。
- 损失函数包括标准Tacotron组件(MSE用于梅尔频谱图,L1用于能量,注意力损失),并增加正则化项以保持情感一致性。
实验结果
研究问题
- RQ1基于PAD框架的连续情感TTS系统能否在多样化情感状态下生成高质量、富有情感表现力的语音?
- RQ2PAD嵌入的注入位置与网络架构如何影响情感语音合成的质量与表现力?
- RQ3该模型在通过PAD插值实现未在训练中见过的情感组合时,其泛化能力如何?
- RQ4在基于Tacotron的TTS系统中,将PAD值注入网络的最优网络配置是什么,以最大化感知质量与情感准确性?
主要发现
- 所提出的模型在情感语音合成中实现了高感知质量,MOS评分显示其自然度与情感表现力与最先进系统相当。
- 该模型成功生成了插值PAD值对应的语音,实现了训练数据中未明确包含的新情感状态的合成。
- 消融实验证实,将PAD嵌入注入解码器的注意力层和PostNet层可获得最佳的情感表现力与语音质量。
- 该模型对不同PAD值表现出鲁棒性,在整个三维PAD空间中均能保持稳定且连贯的语音输出。
- 该系统实现了细粒度的情感控制,允许用户通过PAD参数连续调节情感语调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。