Skip to main content
QUICK REVIEW

[论文解读] Voice Cloning: a Multi-Speaker Text-to-Speech Synthesis Approach based on Transfer Learning

G. Ruggiero, Enrico Zovato|arXiv (Cornell University)|Feb 10, 2021
Speech Recognition and Synthesis参考文献 24被引用 6
一句话总结

本文提出一种基于迁移学习的多说话人文本到语音系统,利用话语级嵌入实现仅需极少目标说话人数据的语音克隆。通过利用预训练说话人验证模型的话语级嵌入,系统可基于简短参考音频片段进行合成,实现高说话人相似度和对未见说话人的鲁棒性,在测试数据上的说话人验证等错误率(EER)为0.040。

ABSTRACT

Deep learning models are becoming predominant in many fields of machine learning. Text-to-Speech (TTS), the process of synthesizing artificial speech from text, is no exception. To this end, a deep neural network is usually trained using a corpus of several hours of recorded speech from a single speaker. Trying to produce the voice of a speaker other than the one learned is expensive and requires large effort since it is necessary to record a new dataset and retrain the model. This is the main reason why the TTS models are usually single speaker. The proposed approach has the goal to overcome these limitations trying to obtain a system which is able to model a multi-speaker acoustic space. This allows the generation of speech audio similar to the voice of different target speakers, even if they were not observed during the training phase.

研究动机与目标

  • 开发一种数据高效的文本到语音系统,仅需少量参考音频即可克隆未见说话人的语音。
  • 通过在不为每个新说话人重新训练的情况下实现多说话人合成,克服单说话人TTS模型的局限性。
  • 通过使用话语嵌入而非固定说话人嵌入来提升语音克隆性能,增强对未见说话人的泛化能力。
  • 评估系统在合成语音中保持音色特征和说话人身份的能力。
  • 展示从预训练说话人验证模型迁移学习在端到端语音克隆中的有效性。

提出的方法

  • 该系统采用三组件架构:说话人编码器、带有注意力机制的序列到序列合成器,以及神经声码器。
  • 说话人编码器通过迁移学习使用预训练的说话人验证模型,从简短参考音频片段中计算话语嵌入。
  • 合成器在同时依赖文本和话语嵌入向量的条件下生成梅尔频谱图,而非依赖固定说话人嵌入。
  • 声码器将生成的梅尔频谱图转换为时域波形。
  • 说话人编码器在验证集上最小化说话人验证错误率(SV-EER),以确保具有判别力的说话人表征。
  • 整个系统通过结合合成损失和说话人嵌入一致性的一体化多任务目标进行端到端训练。

实验结果

研究问题

  • RQ1TTS系统能否仅使用少量参考音频(几秒)就泛化到未见说话人?
  • RQ2与使用说话人嵌入相比,使用话语嵌入是否能提升零样本语音克隆性能?
  • RQ3从预训练说话人验证模型进行迁移学习在多大程度上提升了合成语音中的说话人身份保留能力?
  • RQ4与基线方法相比,该系统在说话人相似度和合成质量方面表现如何?
  • RQ5该系统能否在不为每个新说话人重新训练的情况下保持高音色相似度?

主要发现

  • 所提系统在测试集上达到0.040的说话人验证等错误率(SV-EER),优于基线系统(0.049)。
  • 基于GRU的高级说话人编码器架构在SV-EER方面表现最佳,且训练速度显著快于标准GRU网络。
  • 在八名测试说话人中,生成与真实话语嵌入之间的余弦相似度在0.56至0.76之间,表明说话人表征对齐良好。
  • 主观平均相似度评分(MSS)达到3.17(满分5分),高于基线系统的2.59,表明感知说话人相似度有所提升。
  • 使用UMAP对话语嵌入进行投影后,按性别和身份的说话人聚类清晰可见,证实了鲁棒的说话人表征学习能力。
  • 尽管性能有所提升,系统仍未完全达到人类水平的自然度,韵律再现仍是主要局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。