Skip to main content
QUICK REVIEW

[论文解读] MediumVC: Any-to-any voice conversion using synthetic specific-speaker speeches as intermedium features

Yewei Gu, Zhenyu Zhang|arXiv (Cornell University)|Oct 6, 2021
Speech Recognition and Synthesis参考文献 19被引用 8
一句话总结

MediumVC 提出了一种两阶段任意到任意(A2A)语音转换框架,使用合成的特定说话人语音(SSIF)作为中间特征,将 A2A 分解为任意到一(A2O)和一到任意(O2A)两个阶段。它引入了经过音高偏移且时长保持不变(PSDR)的数据增强方法,以实现鲁棒的 A2O 学习,并利用预训练的 SingleVC 生成 SSIF,使 MediumVC 在未见说话人上实现更优的相似度与自然度。

ABSTRACT

To realize any-to-any (A2A) voice conversion (VC), most methods are to perform symmetric self-supervised reconstruction tasks (Xi to Xi), which usually results in inefficient performances due to inadequate feature decoupling, especially for unseen speakers. We propose a two-stage reconstruction task (Xi to Yi to Xi) using synthetic specific-speaker speeches as intermedium features, where A2A VC is divided into two stages: any-to-one (A2O) and one-to-Any (O2A). In the A2O stage, we propose a new A2O method: SingleVC, by employing a noval data augment strategy(pitch-shifted and duration-remained, PSDR) to accomplish Xi to Yi. In the O2A stage, MediumVC is proposed based on pre-trained SingleVC to conduct Yi to Xi. Through such asymmetrical reconstruction tasks (Xi to Yi in SingleVC and Yi to Xi in MediumVC), the models are to capture robust disentangled features purposefully. Experiments indicate MediumVC can enhance the similarity of converted speeches while maintaining a high degree of naturalness.

研究动机与目标

  • 解决对称自监督 A2A 语音转换中特征解耦效率低下的问题,尤其针对未见说话人。
  • 克服现有 A2A 方法依赖对称重建或离散说话人嵌入所带来的泛化限制。
  • 通过使用合成的特定说话人语音作为中间媒介特征,设计一种两阶段框架,更有效地解耦内容与说话人信息。
  • 通过利用具有合成数据增强的非对称重建任务,提升在未见说话人上的鲁棒性与性能。
  • 证明合成的说话人特定特征(SSIF)在内容与说话人信息的解耦与融合方面优于传统嵌入。

提出的方法

  • 提出一种两阶段 A2A VC 框架:首先通过 SingleVC 实现任意到一(A2O),再通过 MediumVC 实现一到任意(O2A),使用合成的特定说话人语音(SSIF)作为中间媒介特征。
  • 提出一种新颖的数据增强策略——音高偏移且时长保持不变(PSDR),用于生成 A2O 学习的成对非对称训练数据。
  • 在 SingleVC 中使用自监督重建损失(L1)来从音高偏移的输入中重建原始语音,以促进鲁棒的内容表征学习。
  • 在解码器中使用权重归一化(WN)以提升模型对批量归一化或层归一化的鲁棒性。
  • 利用预训练的 SingleVC 生成 SSIF,并将其作为 MediumVC 中 O2A 转换的中间表征。
  • 应用非对称重建:X_i → Ŷ_i(SingleVC)和 Ŷ_i → X̂_i(MediumVC),以实现内容与说话人特征的有目的性解耦。

实验结果

研究问题

  • RQ1使用合成的特定说话人语音作为中间媒介特征的两阶段 A2A 语音转换框架,是否能在泛化到未见说话人方面优于对称自监督方法?
  • RQ2音高偏移且时长保持不变(PSDR)的数据增强策略是否能在保留语言内容的同时实现有效的 A2O 学习?
  • RQ3利用预训练的 SingleVC 生成的 SSIF 在多大程度上提升了 O2A 转换的相似度与自然度?
  • RQ4与对称重建相比,非对称重建任务(X_i → Ŷ_i → X̂_i)在特征解耦方面有何增强效果?
  • RQ5基于 SSIF 的特征表示是否在 A2A VC 性能上优于离散说话人嵌入或 Wav2Vec 2.0 基础特征?

主要发现

  • 在 VCTK 数据集上,MediumVC 的自然度平均意见得分(MOS)达到 3.52,在 LibriSpeech 上为 3.34,显著优于 VCTK 和 LibriSpeech 上的 FragmentVC、AutoVC 和 AdaIn-VC,涵盖已见与未见说话人。
  • 在相似度方面,MediumVC 在 VCTK 上达到 3.82 MOS,在 LibriSpeech 上为 3.25,显著优于 AutoVC(3.21 和 3.21)与 AdaIn-VC(3.04 和 3.07),尤其在未见说话人上表现更优。
  • 消融实验表明,使用预训练 SingleVC 的 MediumVC(Mw/S)优于使用未训练 SingleVC(Mw/uS)和不使用 SingleVC(Mw/oS)的模型,尤其在未见说话人上表现更优,证实了预训练 SSIF 的重要性。
  • 客观评估显示,VCTK 上的说话人验证准确率达到 99.50%,LibriSpeech 上为 98.79%,表明具有强说话人相似度且对未见说话人具有鲁棒性。
  • 该方法在多个数据集(VCTK、LibriSpeech、VCC2020)上均保持高性能,证明其在未见说话人上的泛化能力。
  • 性能提升的关键在于非对称重建与通过 SSIF 实现的鲁棒特征解耦,而非预训练说话人编码器或离散嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。