[论文解读] Seen and Unseen emotional style transfer for voice conversion with a new emotional speech dataset
本文提出一种基于预训练语音情感识别(SER)模型深度情感特征的、采用VAW-GAN架构的一对多情感风格迁移(EST)框架,无需平行训练数据即可实现已见与未见情感的迁移。该方法在频谱与感知指标上达到最先进性能,并发布了新的多说话人、多语言情感语音数据集(ESD)以供社区使用。
Emotional voice conversion aims to transform emotional prosody in speech while preserving the linguistic content and speaker identity. Prior studies show that it is possible to disentangle emotional prosody using an encoder-decoder network conditioned on discrete representation, such as one-hot emotion labels. Such networks learn to remember a fixed set of emotional styles. In this paper, we propose a novel framework based on variational auto-encoding Wasserstein generative adversarial network (VAW-GAN), which makes use of a pre-trained speech emotion recognition (SER) model to transfer emotional style during training and at run-time inference. In this way, the network is able to transfer both seen and unseen emotional style to a new utterance. We show that the proposed framework achieves remarkable performance by consistently outperforming the baseline framework. This paper also marks the release of an emotional speech dataset (ESD) for voice conversion, which has multiple speakers and languages.
研究动机与目标
- 实现无需平行训练数据的一对多情感语音转换。
- 通过连续的深度情感特征而非离散标签,支持已见与未见情感风格的迁移。
- 通过在连续潜在空间中解耦情感语调,提升情感语音转换的泛化能力。
- 解决语音转换研究中缺乏开源、多说话人、多语言情感语音数据集的问题。
- 发布新的情感语音数据集(ESD),以促进语音转换与富有表现力TTS的广泛应用。
提出的方法
- 该框架采用带有条件生成器与判别器的VAW-GAN架构,其中解码器基于预训练SER模型提取的深度情感特征进行条件控制。
- 编码器将输入语音映射为128维潜在向量 $ z $,该向量与256维深度情感特征向量及1维基频轮廓拼接。
- 深度情感特征向量来自预训练SER模型,作为情感风格迁移的连续控制信号。
- 生成器采用4层1D卷积神经网络,卷积核大小为{9,7,7,1025},步长为{3,3,3,1};判别器采用3层1D卷积神经网络,卷积核大小为{7,7,115},步长为{3,3,3}。
- 模型使用RMSProp优化,学习率为1e-5,批量大小为256,训练45个周期。
- 该框架实现端到端训练,无需平行数据,单个模型可完成所有情感转换组合。
实验结果
研究问题
- RQ1单个模型能否在无需平行训练数据的情况下,泛化实现已见与未见情感风格的语音转换?
- RQ2来自预训练SER模型的深度情感特征能否有效在连续潜在空间中表示并控制情感语调?
- RQ3在已见与未见情感方面,所提框架在频谱失真与感知质量方面相较于基线模型表现如何?
- RQ4与离散情感标签相比,使用连续深度情感特征在泛化能力方面提升程度如何?
- RQ5在情感风格迁移过程中,该模型在保留语言内容与说话人身份方面效果如何?
主要发现
- 所提出的DeepEST框架在所有已见情感组合(N2H与N2S)的梅尔倒谱失真(MCD)指标上优于基线VAW-GAN-EVC模型。
- 对于未见情感(愤怒),DeepEST在MCD指标上与专门在愤怒样本上训练的基线模型表现相当,证明其对未见风格具有泛化能力。
- 主观听音测试中,DeepEST在所有已见与未见情感组合上的平均意见得分(MOS)均高于基线模型。
- AB偏好测试显示,DeepEST在所有情感对中均一致优于基线模型的语音质量。
- XAB情感相似度测试表明,尽管基线模型专门针对特定情感(如愤怒)进行训练,DeepEST在情感相似度方面仍表现相当,即使对于未见情感如愤怒亦然。
- 该框架仅需一个模型即可处理所有情感转换组合,而基线模型需为每对情感分别训练三个独立模型,显著提升了效率与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。