Skip to main content
QUICK REVIEW

[论文解读] One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization

Ju-Chieh Chou, Cheng-chieh Yeh|arXiv (Cornell University)|Apr 10, 2019
Speech Recognition and Synthesis参考文献 35被引用 19
一句话总结

本文提出一种一次性语音转换方法,通过实例归一化(IN)分离说话人与内容表征,仅需单个源语音和目标语音样本即可实现对未见说话人的转换。该方法在无需并行数据或说话人标签的情况下,实现高质量、说话人相似的输出,同时学习有意义的无监督说话人嵌入。

ABSTRACT

Recently, voice conversion (VC) without parallel data has been successfully adapted to multi-target scenario in which a single model is trained to convert the input voice to many different speakers. However, such model suffers from the limitation that it can only convert the voice to the speakers in the training data, which narrows down the applicable scenario of VC. In this paper, we proposed a novel one-shot VC approach which is able to perform VC by only an example utterance from source and target speaker respectively, and the source and target speaker do not even need to be seen during training. This is achieved by disentangling speaker and content representations with instance normalization (IN). Objective and subjective evaluation shows that our model is able to generate the voice similar to target speaker. In addition to the performance measurement, we also demonstrate that this model is able to learn meaningful speaker representations without any supervision.

研究动机与目标

  • 解决现有无监督语音转换模型在推理阶段无法泛化到未见说话人的局限性。
  • 实现一次性语音转换,即仅需源说话人和目标说话人各一个参考语音样本,且无需将这些样本包含在训练数据中。
  • 在深度生成模型中解耦说话人身份与语言内容表征,以提升泛化能力与控制性。
  • 证明实例归一化可在无需对抗训练的情况下有效抑制内容表征中的说话人信息。
  • 证明说话人编码器即使在无任何监督或说话人标签的情况下,也能学习到有意义的解耦说话人嵌入。

提出的方法

  • 采用变分自编码器(VAE)框架,包含三个组件:说话人编码器、内容编码器和解码器。
  • 在内容编码器中应用实例归一化(IN),但不使用仿射变换,以归一化通道统计量并去除全局说话人相关特征。
  • 在解码器中使用自适应实例归一化(AdaIN),其中仿射参数由说话人编码器预测,以注入说话人特异性特征。
  • 使用仅非并行、非对齐的语音数据进行端到端训练,无需任何说话人标签或帧级对齐信息。
  • 利用全局平均池化的时间平均特性,结合IN,强制内容编码器丢弃说话人信息。
  • 通过t-SNE可视化和说话人分类准确率评估所学习说话人嵌入的质量。

实验结果

研究问题

  • RQ1实例归一化是否能在无需对抗训练或监督的情况下,有效解耦语音转换模型中的说话人与内容表征?
  • RQ2语音转换模型是否能在推理时仅使用每个说话人一个参考语音样本的情况下泛化到未见说话人?
  • RQ3所提方法是否即使在无任何显式监督或说话人标签的情况下,也能学习到有意义且解耦的说话人嵌入?
  • RQ4在一次性设置下,与目标说话人相比,该模型在说话人相似度和谱 fidelity 方面表现如何?
  • RQ5该模型是否能在无需并行训练数据或帧级对齐信息的情况下实现高质量的语音转换?

主要发现

  • 该模型仅使用一个源语音和一个目标语音样本,即可实现对未见说话人的高质量语音转换,且训练数据中无需包含这些说话人。
  • 客观评估显示,转换语音的全局方差分布与目标说话人高度匹配,表明说话人特征转移准确。
  • 声谱图可视化证实,模型在保留语音内容的同时,成功将基频(F0)和谱包络匹配为目标说话人特征。
  • 使用IN的内容编码器输出的说话人身份分类准确率为0.375,表明残留说话人信息极少;而未使用IN时该值为0.658。
  • 说话人编码器学习到了有意义且解耦的说话人嵌入:即使无任何监督,未见说话人的说话人身份分类准确率仍达99.98%。
  • 主观评估显示,人类听者认为转换后的语音与目标说话人高度相似,相似度评分为4分制,表明感知匹配度强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。