Skip to main content
QUICK REVIEW

[论文解读] Bootstrapping non-parallel voice conversion from speaker-adaptive text-to-speech

Hieu-Thi Luong, Junichi Yamagishi|arXiv (Cornell University)|Sep 14, 2019
Speech Recognition and Synthesis参考文献 39被引用 7
一句话总结

本文提出了一种新颖的框架,通过利用预训练的说话人自适应文本到语音(TTS)模型,从零样本语音转换(VC)系统中进行自举,实现在极低资源条件下仅使用少量目标说话人数据的语音转换。通过利用未转录语音进行基于反向传播的微调,该方法在同语种VC中实现了具有竞争力的性能,并展示了在跨语言VC和跨语言说话人自适应中的可行性,即使面对未见过的语言也表现良好。

ABSTRACT

Voice conversion (VC) and text-to-speech (TTS) are two tasks that share a similar objective, generating speech with a target voice. However, they are usually developed independently under vastly different frameworks. In this paper, we propose a methodology to bootstrap a VC system from a pretrained speaker-adaptive TTS model and unify the techniques as well as the interpretations of these two tasks. Moreover by offloading the heavy data demand to the training stage of the TTS model, our VC system can be built using a small amount of target speaker speech data. It also opens up the possibility of using speech in a foreign unseen language to build the system. Our subjective evaluations show that the proposed framework is able to not only achieve competitive performance in the standard intra-language scenario but also adapt and convert using speech utterances in an unseen language.

研究动机与目标

  • 通过利用说话人自适应TTS模型实现VC自举,将语音转换(VC)与文本到语音(TTS)统一于共享框架下。
  • 通过将VC的高数据需求转移至TTS预训练阶段,降低VC对数据的依赖,实现在仅使用少量目标说话人语音的情况下进行VC。
  • 通过适应目标说话人的未转录外语语音,实现在低资源或未见语言中的VC。
  • 评估系统在跨语言场景下的性能,包括跨语言说话人自适应和语种间语音转换。

提出的方法

  • 利用在未转录语音上通过反向传播预训练的说话人自适应TTS模型,提取说话人无关的潜在语言表征(LLE)。
  • 通过使用目标说话人语音对端到端反向传播进行微调,将TTS模型的说话人自适应能力迁移至VC系统。
  • 通过一个潜在变量(LLE)解耦语言内容与说话人身份,实现说话人特征与语言内容的分离。
  • 在非平行设置下训练VC系统,通过微调后的TTS模型将源说话人特征映射至目标说话人特征,无需并行训练数据。
  • 通过使用目标说话人的外语语音进行适应,将相同框架应用于跨语言场景,将其视为零资源适应任务。
  • 采用序列到序列架构,以在转换过程中保持语速和语言内容,确保自然的语调。

实验结果

研究问题

  • RQ1能否通过说话人自适应TTS模型有效自举非平行VC系统,从而降低对数据的依赖?
  • RQ2在使用未转录、未见过的语言语音时,所提出的框架在跨语言语音转换中的表现如何?
  • RQ3在低资源语言场景下,该系统能否实现具有竞争力的说话人相似度和语音质量?
  • RQ4跨语言说话人自适应是否会降低性能,是否仍能产生可接受的感知结果?

主要发现

  • 所提出的框架在标准同语种VC中实现了具有竞争力的性能,在VCC2018基准测试中质量排名第三,说话人相似度排名第六。
  • 主观评估表明,系统在同性别和跨性别说话人对中均表现出一致性能,显示出良好的鲁棒性。
  • 系统成功实现了跨语言说话人自适应(EJ-E),尽管得分低于同语种英语(EE-E),表明存在可测量但可接受的性能下降。
  • 在低资源语言场景(EE-J 和 EJ-J)中,系统展示了跨语言转换的可行性,其中 EJ-J 表现优于 EE-J,表明存在一定程度的跨语言迁移。
  • 相似度评估显示,即使由同一双语说话人说出,自然英语语音(NA-E)的评分显著低于自然日语语音(NA-J),表明跨语言相似度感知存在挑战。
  • 结果为未来在低资源和多语言VC方向的研究建立了强有力的基线,尤其在获得更多多语言数据后更具潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。