[论文解读] Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training
本文提出了一种两阶段序列到序列(seq2seq)情感语音转换(EVC)框架,利用文本到语音(TTS)预训练来缓解数据稀缺问题。通过首先利用多说话人TTS进行风格解耦初始化,然后在有限的情感语音数据上微调,该方法在频谱和语调转换方面均实现了最先进(SOTA)性能,在客观和主观评估中显著优于基线模型,且仅需极少的标注数据。
Emotional voice conversion (EVC) aims to change the emotional state of an utterance while preserving the linguistic content and speaker identity. In this paper, we propose a novel 2-stage training strategy for sequence-to-sequence emotional voice conversion with a limited amount of emotional speech data. We note that the proposed EVC framework leverages text-to-speech (TTS) as they share a common goal that is to generate high-quality expressive voice. In stage 1, we perform style initialization with a multi-speaker TTS corpus, to disentangle speaking style and linguistic content. In stage 2, we perform emotion training with a limited amount of emotional speech data, to learn how to disentangle emotional style and linguistic information from the speech. The proposed framework can perform both spectrum and prosody conversion and achieves significant improvement over the state-of-the-art baselines in both objective and subjective evaluation.
研究动机与目标
- 解决在有限情感语音数据下训练高质量情感语音转换(EVC)系统的挑战。
- 利用文本到语音(TTS)与EVC在表达性语音生成方面的共同目标,以提升模型泛化能力和风格解耦性能。
- 实现在无需平行训练数据的情况下实现多对多情感语音转换。
- 通过注意力机制将对齐方式从帧级升级为序列级,以改善语调和时长建模。
- 通过仅使用有限情感语音数据对WaveRNN声码器进行情感特定微调,以提升音质。
提出的方法
- 第一阶段:使用多说话人TTS语料进行风格初始化,以实现语言内容与说话风格的解耦。
- 第二阶段:在有限情感语音数据上微调整个模型,以学习特定于情感的风格解耦。
- 集成情感编码器和分类器,以抑制语言空间中的情感相关信息。
- 采用基于注意力的seq2seq架构,对声学与语言嵌入之间的对齐进行建模,以实现分层语调建模。
- 仅使用有限情感语音数据对WaveRNN声码器进行情感特定微调,以提升主观音质。
- 采用端到端训练方式,通过序列级监督联合优化频谱和时长转换。

实验结果
研究问题
- RQ1两阶段训练策略是否能降低seq2seq情感语音转换中的数据依赖性?
- RQ2在低资源场景下,TTS预训练是否能有效实现语言内容与情感及说话人风格的解耦?
- RQ3与帧级方法相比,序列级注意力建模是否能提升语调和时长转换性能?
- RQ4对WaveRNN声码器进行情感特定微调是否能在极少数据下提升主观音质?
- RQ5所提出的框架在客观指标和主观听音测试中与SOTA基线相比表现如何?
主要发现
- 所提出的Seq2seq-EVC-WA1和Seq2seq-EVC-WA2模型在所有情感对中均达到最低的MCD值,显著优于CycleGAN-EVC和StarGAN-EVC。
- 经过微调WaveRNN的模型(Seq2seq-EVC-WA2)在DDUR指标上表现最佳,证明其具备优越的时长转换能力。
- 主观听音测试显示,90%的听者认为Seq2seq-EVC-WA2在Neu-Sad情感对中语音质量最佳。
- 情感相似度评分显示,Seq2seq-EVC-WA2显著优于基线模型,尤其在Neu-Sur对中,平均得分提升+1.8(在-2至+2量表上)。
- 注意力机制实现了可变的语音时长映射,如对齐可视化所示,同一源语音在生成快乐和悲伤目标时产生了不同的时长。
- 对WaveRNN声码器进行情感微调在语音质量上带来一致提升,该结论得到最佳-最差选择法(BWS)结果的验证。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。