[论文解读] VAW-GAN for Disentanglement and Recomposition of Emotional Elements in Speech
该论文提出了一种使用VAW-GAN进行解耦与重组的说话人相关情感语音转换框架,通过连续小波变换(CWT)实现多尺度语调建模,并在解码器中引入基频(F0)特征进行条件控制,相比使用线性F0变换的基线模型,在客观和主观评估中均实现了更优的语音质量和情感相似度。
Emotional voice conversion (EVC) aims to convert the emotion of speech from one state to another while preserving the linguistic content and speaker identity. In this paper, we study the disentanglement and recomposition of emotional elements in speech through variational autoencoding Wasserstein generative adversarial network (VAW-GAN). We propose a speaker-dependent EVC framework based on VAW-GAN, that includes two VAW-GAN pipelines, one for spectrum conversion, and another for prosody conversion. We train a spectral encoder that disentangles emotion and prosody (F0) information from spectral features; we also train a prosodic encoder that disentangles emotion modulation of prosody (affective prosody) from linguistic prosody. At run-time, the decoder of spectral VAW-GAN is conditioned on the output of prosodic VAW-GAN. The vocoder takes the converted spectral and prosodic features to generate the target emotional speech. Experiments validate the effectiveness of our proposed method in both objective and subjective evaluations.
研究动机与目标
- 解决在语音中从语言内容和说话人身份中解耦情感语调的挑战,以实现情感语音转换。
- 开发一种非平行、说话人相关的EVC框架,实现多对多的情感迁移。
- 通过使用连续小波变换(CWT)在多个时间尺度上表示F0,提升语调建模能力。
- 通过在解码器中引入F0条件控制,提升情感迁移性能。
- 通过客观和主观评估验证所提方法的有效性。
提出的方法
- 该框架使用两个VAW-GAN流程:一个用于频谱特征转换,另一个用于语调特征转换。
- 频谱编码器利用VAW-GAN从频谱特征中解耦情感与语调(F0)信息。
- 语调编码器利用CWT分解的F0特征,从语言语调中解耦情感语调(情感调制)。
- 频谱VAW-GAN的解码器通过条件控制于语调VAW-GAN的输出,生成目标情感语音。
- 对F0应用CWT,以在多个时间尺度上建模语调,提升情感语调的表征能力。
- 声码器基于转换后的频谱与语调特征重建最终语音,其中F0条件控制提升了重建保真度。
实验结果
研究问题
- RQ1VAW-GAN能否在非平行语音数据中有效解耦情感语调与语言语调及说话人身份?
- RQ2与线性F0变换相比,基于CWT的F0表征是否能提升语调建模与情感语音转换性能?
- RQ3在解码器中引入F0特征条件控制,对转换后语音的语音质量与情感相似度有何影响?
- RQ4所提框架是否能在无平行数据的情况下,实现优于基线EVC方法的主观与客观性能?
- RQ5通过CWT实现的多尺度语调建模,在说话人相关语音转换中在多大程度上提升了情感迁移效果?
主要发现
- 所提VAW-GAN(SP+CWT+C)框架在语调转换的RMSE与PCC指标上显著优于基线VAW-GAN(SP+F0+C),表明F0建模能力得到提升。
- 通过F0特征条件控制解码器,显著提升了语音质量,XAB测试结果一致显示对所提框架的偏好高于无条件基线。
- 在XAB听音测试中,所提框架实现了更优的情感相似度,尤其在N2A(中性到愤怒)转换中,其CWT基F0建模表现优于基线。
- 使用CWT进行F0表征相比传统基于LG的线性F0变换,显著提升了情感性能,尤其在复杂情感转换(如N2A)中表现更优。
- 主观评估证实,所提方法生成的语音更具自然感与情感表现力,听众在语音质量与情感真实性方面均更偏好该方法。
- 该框架在仅使用非平行训练数据的说话人相关情感语音转换中表现出稳健性能,验证了其在解耦与重组情感元素方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。