[论文解读] Multi-Target Emotional Voice Conversion With Neural Vocoders
该论文提出了一种使用深度双向LSTM(DBLSTM)转换模型与神经声码器的多目标情感语音转换(MTEVC)系统,结合音素后验gram(PPGs)以提升语言建模效果。该系统采用基于流的神经声码器FloWaveNet,实现了最先进性能,在多个情感对的频谱与基频转换指标上优于Griffin-Lim和自回归WaveNet。
Emotional voice conversion (EVC) is one way to generate expressive synthetic speech. Previous approaches mainly focused on modeling one-to-one mapping, i.e., conversion from one emotional state to another emotional state, with Mel-cepstral vocoders. In this paper, we investigate building a multi-target EVC (MTEVC) architecture, which combines a deep bidirectional long-short term memory (DBLSTM)-based conversion model and a neural vocoder. Phonetic posteriorgrams (PPGs) containing rich linguistic information are incorporated into the conversion model as auxiliary input features, which boost the conversion performance. To leverage the advantages of the newly emerged neural vocoders, we investigate the conditional WaveNet and flow-based WaveNet (FloWaveNet) as speech generators. The vocoders take in additional speaker information and emotion information as auxiliary features and are trained with a multi-speaker and multi-emotion speech corpus. Objective metrics and subjective evaluation of the experimental results verify the efficacy of the proposed MTEVC architecture for EVC.
研究动机与目标
- 为解决一对一情感语音转换(EVC)的局限性,通过单一模型实现多目标EVC。
- 通过用神经声码器替代传统Mel倒谱声码器,提升语音自然度与转换准确性。
- 通过引入与说话人无关的音素后验gram(PPGs)作为辅助特征,增强EVC中的语言建模能力。
- 通过使用说话人与情感编码,在多说话人与多情感数据上训练神经声码器,以实现更好的泛化能力。
- 通过客观指标与主观听音测试,评估所提出的MTEVC框架。
提出的方法
- 基于DBLSTM的转换模型以源Mel谱图与PPGs作为输入,情感编码作为独热辅助特征,用于控制目标情感状态。
- 系统采用条件WaveNet与基于流的WaveNet(FloWaveNet)作为神经声码器,其条件为Mel谱图,并注入说话人与情感编码。
- PPGs从与说话人无关的自动语音识别(ASR)系统中提取,以提供鲁棒的语言上下文,且无需并行训练数据。
- 神经声码器在多说话人、多情感语料上进行训练,以学习与说话人及情感相关的语音特征。
- 框架支持端到端训练,FloWaveNet使用最大似然损失,WaveNet采用自回归生成。
- 情感编码用于同时控制转换模型与声码器,实现灵活的多目标转换。
实验结果
研究问题
- RQ1单一MTEVC模型是否能跨多个情感状态进行泛化,而无需为每对情感分别训练模型?
- RQ2将PPGs作为辅助特征是否能提升DBLSTM转换模型在频谱与基频转换中的性能?
- RQ3与传统Mel倒谱声码器相比,WaveNet与FloWaveNet等神经声码器在频谱与语调保真度方面表现如何?
- RQ4在多说话人与多情感数据上训练神经声码器,是否能实现共享参数的高保真、情感特异性语音合成?
- RQ5在多目标EVC中,WaveNet与FloWaveNet哪一种声码器在质量、速度与泛化能力之间达到最佳平衡?
主要发现
- FloWaveNet在所有情感对中均取得最低的MCD(8.05–8.84),在频谱转换方面优于WaveNet与Griffin-Lim。
- 与不使用PPGs的基线模型相比,本模型引入PPGs作为辅助输入后,MCD降低最多达1.5 dB,表明频谱重建能力得到提升。
- 在基频转换方面,本模型取得最低的LogF0-MSE(1.05–2.74),在中性到悲伤与中性到愤怒的转换中表现最佳。
- 主观评估显示,P-WaveNet在中性到快乐转换中正确分类率达到86.7%,而P-FloWaveNet在中性到悲伤转换中达到80.1%,表明情感转移准确性优异。
- B-FloWaveNet模型在中性到悲伤转换中正确分类率达到38.9%,表明即使基线模型使用FloWaveNet,其情感感知性能也优于其他模型。
- 在声码器中使用说话人与情感编码,实现了单一共享模型在多个说话人与情感间生成高保真、情感特异性的语音。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。