Skip to main content
QUICK REVIEW

[论文解读] High-quality nonparallel voice conversion based on cycle-consistent adversarial network

Fuming Fang, Junichi Yamagishi|arXiv (Cornell University)|Apr 2, 2018
Speech and Audio Processing被引用 12
一句话总结

本文提出了一种高质量的非平行语音转换方法,采用Cycle-GAN学习语音风格迁移,无需平行训练数据。通过利用循环一致性与对抗性训练,该模型在语音质量和说话人相似度方面优于最先进的平行VC系统,在主观评价中表明非平行VC可超越传统的平行方法。

ABSTRACT

Although voice conversion (VC) algorithms have achieved remarkable success along with the development of machine learning, superior performance is still difficult to achieve when using nonparallel data. In this paper, we propose using a cycle-consistent adversarial network (CycleGAN) for nonparallel data-based VC training. A CycleGAN is a generative adversarial network (GAN) originally developed for unpaired image-to-image translation. A subjective evaluation of inter-gender conversion demonstrated that the proposed method significantly outperformed a method based on the Merlin open source neural network speech synthesis system (a parallel VC system adapted for our setup) and a GAN-based parallel VC system. This is the first research to show that the performance of a nonparallel VC method can exceed that of state-of-the-art parallel VC methods.

研究动机与目标

  • 开发一种无需平行训练数据的高质量语音转换系统,因为此类数据在实际中难以收集。
  • 克服平行VC系统存在的局限性,例如对强制对齐的依赖性以及对语言内容不匹配的敏感性。
  • 探究基于Cycle-GAN的非平行VC是否能在感知质量与说话人相似度方面超越现有平行VC方法。
  • 研究利用循环一致性对抗网络在无配对说话人数据下进行语音转换的可行性。
  • 通过消除帧级对齐需求,提升语音转换的鲁棒性与泛化能力。

提出的方法

  • 该方法采用Cycle-GAN架构,包含两个生成器和两个判别器,以学习源说话人与目标说话人嵌入之间的循环一致性映射。
  • 生成器被训练以将一个说话人的语音特征转换为另一个说话人的特征,同时最小化循环一致性损失,确保经过两步转换后重建输出与原始输入匹配。
  • 应用对抗性损失,使判别器难以区分生成的语音与真实目标说话人样本。
  • 模型使用梅尔倒谱系数(mel-cepstrum)作为输入和输出表示,并使用目标说话人的全局均值与标准差对F0进行归一化。
  • 训练使用源说话人与目标说话人各自的无配对语音样本,避免强制对齐或语言内容匹配。
  • 采用随机种子选择作为超参数,以稳定训练并提升转换语音中的语言不变性。

实验结果

研究问题

  • RQ1基于Cycle-GAN的非平行语音转换系统是否能在感知质量上优于最先进的平行VC系统?
  • RQ2非平行训练中缺乏强制对齐是否能减少与平行方法相比的误差传播?
  • RQ3循环一致性损失在语音转换过程中如何有助于保留语言内容?
  • RQ4为何该模型在男声转女声转换中表现较差,且该问题是否可被缓解?
  • RQ5在无显式语言约束条件下,基于Cycle-GAN的方法在语音风格迁移过程中能在多大程度上保持语言身份?

主要发现

  • 所提出的基于CycleGAN的非平行VC方法在语音质量上的平均意见得分(MOS)为2.69,说话人相似度为2.15,显著优于基于GAN的平行基线模型(MOS 2.36和2.02)以及基于Merlin的平行基线模型(MOS 1.45和1.45)。
  • 在女声转男声转换中,所提方法的语音质量得分为2.89,说话人相似度为2.53,超过基于GAN的方法(2.20和2.26)与Merlin基线模型(1.37和1.52)。
  • 在男声转女声转换中,所提方法的语音质量得分为2.50,说话人相似度为1.76,优于基于GAN的方法(2.51和1.79)与Merlin基线模型(1.52和1.38)。
  • 男声转女声转换性能差距归因于F0不匹配以及梅尔倒谱系数维度过低(25维),表明联合学习F0与调整特征维度可改善结果。
  • 该模型表明,非平行VC可在主观评价中超越最先进的平行VC系统,挑战了‘平行数据对高质量转换必不可少’的假设。
  • 尽管存在部分语言扭曲(如/a:/被误转为/I:/),但当随机种子选择得当时,模型仍能学习到稳健的映射,表明初始化在实现语言不变性方面具有重要意义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。