Skip to main content
QUICK REVIEW

[论文解读] Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice Conversion

Kun Zhou, Berrak Şişman|arXiv (Cornell University)|May 13, 2020
Speech Recognition and Synthesis参考文献 41被引用 15
一句话总结

该论文提出了一种基于VAW-GAN的编码器-解码器架构的说话人无关情感语音转换框架,可在无需并行训练数据的情况下实现情感转换。通过利用连续小波变换(CWT)进行韵律建模,并将解码器基于CWT提取的F0特征进行条件化,该方法在已见和未见说话人上均实现了高质量、说话人保留的情感转换,在情感相似性方面优于说话人相关的基线模型,同时保持了说话人身份。

ABSTRACT

Emotional voice conversion aims to convert the emotion of speech from one state to another while preserving the linguistic content and speaker identity. The prior studies on emotional voice conversion are mostly carried out under the assumption that emotion is speaker-dependent. We consider that there is a common code between speakers for emotional expression in a spoken language, therefore, a speaker-independent mapping between emotional states is possible. In this paper, we propose a speaker-independent emotional voice conversion framework, that can convert anyone's emotion without the need for parallel data. We propose a VAW-GAN based encoder-decoder structure to learn the spectrum and prosody mapping. We perform prosody conversion by using continuous wavelet transform (CWT) to model the temporal dependencies. We also investigate the use of F0 as an additional input to the decoder to improve emotion conversion performance. Experiments show that the proposed speaker-independent framework achieves competitive results for both seen and unseen speakers.

研究动机与目标

  • 探究语音中的情感表达是否包含可被用于情感转换的说话人无关模式。
  • 开发一种无需并行训练数据的说话人无关情感语音转换框架。
  • 通过使用连续小波变换(CWT)捕捉基频中的时序依赖关系,改进情感语音转换中的韵律建模。
  • 通过将解码器基于CWT提取的F0特征进行条件化,提升频谱和韵律转换的性能。
  • 验证说话人无关训练相比说话人相关训练在泛化能力上更具优势,尤其针对未见说话人。

提出的方法

  • 该框架采用基于VAW-GAN的编码器-解码器结构,学习在频谱和韵律特征中不同情感状态之间的说话人无关映射。
  • 通过连续小波变换(CWT)对韵律进行建模,以多时间-频率分辨率表示基频轮廓,捕捉分层的和超音段的情感线索。
  • 通过将解码器基于CWT变换后的F0特征进行条件化,提升情感转换过程中频谱重建的准确性。
  • 采用循环一致性对抗损失进行端到端训练,无需并行训练数据。
  • 使用多说话人数据集进行训练,以实现对已见和未见说话人的说话人无关泛化能力。
  • 通过MOS、XAB情感相似性测试和XAB说话人相似性测试对框架进行评估,以衡量情感保真度和说话人保留能力。

实验结果

研究问题

  • RQ1语音中的情感表达能否以说话人无关的方式建模,从而实现在无并行数据情况下的跨说话人转换?
  • RQ2将解码器基于CWT变换后的F0特征进行条件化,是否能提升情感语音转换的质量?
  • RQ3在情感相似性和说话人身份保留方面,说话人无关训练与说话人相关训练相比表现如何?
  • RQ4所提出的框架是否能泛化到未见说话人,同时保持高情感保真度和说话人身份?
  • RQ5是否可能仅使用非并行、多说话人数据实现高质量的情感语音转换?

主要发现

  • CWT-C-VAWGAN框架的平均意见得分(MOS)为2.808 ± 0.137,显著优于CWT-VAWGAN(2.731 ± 0.163),证实了F0条件化的有效性。
  • 在XAB情感相似性测试中,说话人无关训练在已见和未见说话人上均优于说话人相关训练,听者对未见说话人的说话人无关方法评价更高。
  • 所提出的CWT-C-VAWGAN框架在说话人相似性方面与说话人相关基线模型(SD-CWT-C-VAWGAN)相当,表明情感转换不会损害说话人身份。
  • XAB测试证实,说话人无关模型能有效泛化到未见说话人,展现出良好的鲁棒性和泛化能力。
  • 结果验证了说话人无关情感语音转换在无并行数据或说话人特定微调的情况下是可行且有效的。
  • 本研究首次证明,单一统一模型即可在已见和未见说话人上实现具有竞争力的说话人无关情感语音转换性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。