Skip to main content
QUICK REVIEW

[论文解读] From Speaker Verification to Multispeaker Speech Synthesis, Deep Transfer with Feedback Constraint

Zexin Cai, Chuxiong Zhang|arXiv (Cornell University)|May 10, 2020
Speech Recognition and Synthesis参考文献 27被引用 5
一句话总结

本文提出了一种多说话人文本到语音系统,通过将说话人验证网络作为反馈约束,增强了说话人身份克隆能力。通过添加一个损失项,使合成语音的嵌入与参考说话人嵌入对齐,模型显著提升了说话人相似度,表现为等错误率(EER)降低以及嵌入空间可视化中聚类更紧密。

ABSTRACT

High-fidelity speech can be synthesized by end-to-end text-to-speech models in recent years. However, accessing and controlling speech attributes such as speaker identity, prosody, and emotion in a text-to-speech system remains a challenge. This paper presents a system involving feedback constraint for multispeaker speech synthesis. We manage to enhance the knowledge transfer from the speaker verification to the speech synthesis by engaging the speaker verification network. The constraint is taken by an added loss related to the speaker identity, which is centralized to improve the speaker similarity between the synthesized speech and its natural reference audio. The model is trained and evaluated on publicly available datasets. Experimental results, including visualization on speaker embedding space, show significant improvement in terms of speaker identity cloning in the spectrogram level. Synthesized samples are available online for listening. (https://caizexin.github.io/mlspk-syn-samples/index.html)

研究动机与目标

  • 改善端到端多说话人TTS系统中的说话人身份克隆。
  • 解决合成语音与自然语音之间说话人相似度不足的问题,特别是针对未见说话人的情况。
  • 通过迁移预训练验证模型中的判别性说话人表征,实现更鲁棒的开放集语音克隆。
  • 减少合成语音与自然语音嵌入之间的分布差异。
  • 探索在数据增强和说话人验证系统白盒欺骗攻击中的应用。

提出的方法

  • 在TTS训练过程中,将预训练的说话人验证网络作为反馈约束集成。
  • 基于验证网络得分添加一个说话人相似度损失,以对齐合成语音嵌入与参考说话人嵌入。
  • 采用联合训练框架,使TTS模型同时优化合成损失与反馈约束损失。
  • 应用反馈约束,促使合成语音嵌入在相同说话人类别中紧密聚集于自然参考嵌入附近。
  • 在TTS架构中使用残差连接与归一化层以稳定训练过程。
  • 利用验证网络中的说话人嵌入作为语音克隆的条件向量。
Figure 1: The overall training framework of deep speaker verification systems
Figure 1: The overall training framework of deep speaker verification systems

实验结果

研究问题

  • RQ1来自说话人验证系统的反馈约束是否能改善多说话人TTS中的说话人身份克隆?
  • RQ2所提出的方法是否减少了合成语音与自然语音嵌入之间的分布差距?
  • RQ3反馈约束在已见与未见说话人条件下对说话人相似度有何影响?
  • RQ4与基线TTS系统相比,该模型能否在开放集语音克隆任务中实现更优性能?
  • RQ5反馈约束对等错误率(EER)与余弦相似度等客观指标有何影响?

主要发现

  • 所提出的反馈约束(FC)系统在VCTK测试集上将SV-EER相对降低了50.8%(从14.72%降至8.22%,适用于文本依赖条件)。
  • 在Librispeech数据集上,FC系统将EER从基线的26.84%降低至16.54%(文本依赖合成),表明说话人判别能力得到提升。
  • 在VCTK测试集(文本依赖)上,合成语音与参考嵌入之间的余弦相似度从0.403提升至0.764,表明说话人身份对齐更强。
  • t-SNE可视化结果证实,使用FC方法生成的合成语音嵌入与自然语音嵌入聚类紧密,而基线模型则显示出分布偏移。
  • 主观评估显示,在VCTK测试集上65.8%的对比对更偏好FC系统,在Librispeech数据集上达到73.7%,表明感知说话人相似度更高。
  • 该模型实现了高保真度的语音克隆,并在未见说话人上表现出更强鲁棒性,表明其在数据增强与白盒欺骗攻击方面具有潜在应用价值。
Figure 2: Proposed multi-speaker speech synthesis model
Figure 2: Proposed multi-speaker speech synthesis model

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。