Skip to main content
QUICK REVIEW

[论文解读] Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training

Haohan Guo, Heng Lu|arXiv (Cornell University)|Dec 3, 2020
Music and Audio Processing参考文献 26被引用 10
一句话总结

本文提出了一种端到端对抗性演唱语音转换(EA-SVC)系统,通过使用基于MelGAN的生成器、CNN-BLSTM编码器以及对抗性训练,从音素后验图(PPG)、基频(F0)和说话人嵌入生成高保真演唱波形。主要贡献包括将说话人嵌入分解为音色聚类、采用特征解耦判别器以消除PPG中的音高/音色泄漏,以及采用两阶段训练策略,从而在级联方法和WaveNet基线方法上实现了更优的演唱质量与说话人相似度。

ABSTRACT

This paper describes an end-to-end adversarial singing voice conversion (EA-SVC) approach. It can directly generate arbitrary singing waveform by given phonetic posteriorgram (PPG) representing content, F0 representing pitch, and speaker embedding representing timbre, respectively. Proposed system is composed of three modules: generator $G$, the audio generation discriminator $D_{A}$, and the feature disentanglement discriminator $D_F$. The generator $G$ encodes the features in parallel and inversely transforms them into the target waveform. In order to make timbre conversion more stable and controllable, speaker embedding is further decomposed to the weighted sum of a group of trainable vectors representing different timbre clusters. Further, to realize more robust and accurate singing conversion, disentanglement discriminator $D_F$ is proposed to remove pitch and timbre related information that remains in the encoded PPG. Finally, a two-stage training is conducted to keep a stable and effective adversarial training process. Subjective evaluation results demonstrate the effectiveness of our proposed methods. Proposed system outperforms conventional cascade approach and the WaveNet based end-to-end approach in terms of both singing quality and singer similarity. Further objective analysis reveals that the model trained with the proposed two-stage training strategy can produce a smoother and sharper formant which leads to higher audio quality.

研究动机与目标

  • 开发一种端到端演唱语音转换系统,实现任意音色迁移,同时保证高音频质量与说话人相似度。
  • 通过确保特征解耦,解决演唱语音转换中内容、音高与音色表征之间的相互依赖问题。
  • 通过结合对抗性训练与两阶段训练策略及多分辨率STFT损失,提升音频保真度与稳定性。
  • 通过解耦的说话人嵌入分解实现可控的音色迁移与音高调控。
  • 在主观与客观评估中均优于传统的级联方法与WaveNet基端到端方法。

提出的方法

  • 基于MelGAN的生成器将PPG、F0与说话人嵌入映射为波形,采用并行的CNN-BLSTM编码器从PPG与F0中提取序列上下文信息。
  • 将说话人嵌入分解为可学习向量的加权和,以表示不同的音色/说话人聚类,从而提升音色表征的稳定性和可控性。
  • 采用两个判别器:$D_A$用于音频生成,以提升波形的真实性;$D_F$用于从编码后的PPG中解耦音高与音色信息。
  • 采用两阶段训练策略:首先使用多分辨率STFT(MR-STFT)损失进行预训练,随后联合使用MR-STFT损失与对抗性损失进行端到端训练,以稳定GAN训练过程。
  • 特征解耦判别器$D_F$被训练为从编码后的PPG中预测F0与说话人嵌入,从而强制PPG表征不包含音高与音色信息。
  • 系统通过对抗性损失与重建损失进行端到端训练,实现从内容、音高与音色特征直接生成波形。

实验结果

研究问题

  • RQ1单一端到端模型能否实现高质量演唱语音转换,支持任意音色迁移与稳定的音高控制?
  • RQ2将说话人嵌入分解为音色聚类在提升音色表征与转换可控性方面效果如何?
  • RQ3引入特征解耦判别器($D_F$)是否能减少PPG表征中的音高与音色泄漏,并提升音频质量?
  • RQ4两阶段训练策略在多大程度上提升了对抗性训练在演唱语音转换中的稳定性与性能?
  • RQ5与级联方法及WaveNet基端到端方法相比,所提方法在演唱质量与说话人相似度方面表现如何?

主要发现

  • 所提出的EA-SVC模型在演唱质量上的平均意见得分(MOS)为3.78 ± 0.11,在说话人相似度上为3.60 ± 0.13,优于级联方法与WaveNet基端到端方法。
  • 消融实验表明,若同时移除说话人嵌入分解与$D_F$,性能最差(质量MOS为3.26 ± 0.11),证实了两个组件的必要性。
  • 仅使用说话人嵌入分解的模型将MOS提升至3.52 ± 0.12(质量)与3.55 ± 0.12(相似度),表明音色表征鲁棒性得到增强。
  • 特征解耦判别器$D_F$显著减少了音高跳变与共振峰模糊,使频谱图中的共振峰更清晰、更锐利。
  • 两阶段训练策略相比仅使用对抗性损失的模型,生成的共振峰更平滑、更锐利,频谱图对比结果清晰显示了这一点。
  • 音色迁移实验表明,分解方法支持在音色间进行线性、可控的插值,而非分解模型则无法保持一致的频谱趋势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。