Skip to main content
QUICK REVIEW

[论文解读] Cross-Lingual Text-to-Speech Using Multi-Task Learning and Speaker Classifier Joint Training

Yang, J., Lei He|arXiv (Cornell University)|Jan 20, 2022
Speech Recognition and Synthesis被引用 6
一句话总结

本文提出了一种多任务学习(MTL)与说话人分类器联合训练框架,以提升多语言文本到语音(TTS)系统中的跨语言说话人相似度。通过将多语言Transformer TTS模型与x-vector说话人分类器联合训练,并采用近似并行调度采样方法,该模型在多种语言中对已见和未见说话人均实现了显著更高的说话人相似度,客观与主观评估均证实了性能的持续提升。

ABSTRACT

In cross-lingual speech synthesis, the speech in various languages can be synthesized for a monoglot speaker. Normally, only the data of monoglot speakers are available for model training, thus the speaker similarity is relatively low between the synthesized cross-lingual speech and the native language recordings. Based on the multilingual transformer text-to-speech model, this paper studies a multi-task learning framework to improve the cross-lingual speaker similarity. To further improve the speaker similarity, joint training with a speaker classifier is proposed. Here, a scheme similar to parallel scheduled sampling is proposed to train the transformer model efficiently to avoid breaking the parallel training mechanism when introducing joint training. By using multi-task learning and speaker classifier joint training, in subjective and objective evaluations, the cross-lingual speaker similarity can be consistently improved for both the seen and unseen speakers in the training set.

研究动机与目标

  • 解决仅使用单语说话人数据时,跨语言文本到语音合成中说话人相似度低的挑战。
  • 提升合成的跨语言语音与原生录音之间的说话人相似度,尤其针对未见说话人。
  • 开发一种无需多语种数据或基于说话人编码器的系统即可增强说话人表征的训练框架。
  • 在仅用少量数据微调新未见说话人时,仍能保持高说话人相似度,实现有效模型微调。

提出的方法

  • 提出一种多任务学习(MTL)框架,在多语言Transformer TTS模型中增加说话人和语言身份分类器,使用交叉熵损失以促进嵌入学习的准确性。
  • 将TTS模型与x-vector说话人分类器联合训练,以最小化同一说话人原始录音与合成跨语言语音之间x-vector的距离。
  • 采用近似并行调度采样方案,在联合训练过程中保持并行训练效率,即使需要在推理模式下生成语音。
  • 在Transformer TTS框架中使用固定维度的说话人嵌入和语言嵌入,以建模说话人和语言特征。
  • 在说话人扩展过程中采用语言平衡训练,防止在微调低资源新说话人时发生过拟合。
  • 利用x-vector系统作为可微分目标,引导TTS模型生成与说话人身份在多语言中一致的语音。

实验结果

研究问题

  • RQ1多任务学习是否能在不依赖多语种数据或说话人编码器的情况下,提升跨语言TTS中的说话人相似度?
  • RQ2与x-vector说话人分类器联合训练在提升已见和未见说话人跨语言说话人相似度方面效果如何?
  • RQ3所提方法是否能在训练过程中实现联合优化并支持推理模式生成的同时,保持训练效率?
  • RQ4该方法在不同训练数据规模的多种语言中,对说话人相似度的提升程度如何?
  • RQ5该模型是否能在仅用少量数据的情况下泛化到新的未见说话人,同时保持高说话人相似度?

主要发现

  • +MTL+Joint模型在已见说话人的跨语言合成中,平均将余弦距离降低了34%,尤其在低资源语言中提升最为显著。
  • 对于仅约9分钟数据的新中文(简体)说话人,相似度MOS从基线的3.99 ± 0.09提升至4.21 ± 0.07,表明主观感知有显著改善。
  • 在客观评估中,该新中文(简体)说话人的余弦距离在各语言中从0.096降至0.092,显示出一致的性能提升。
  • 对于仅约5分钟数据的新英式英语(en-GB)说话人,目标语言中的余弦距离从0.088降至0.083,跨语言设置中则从0.224降至0.164。
  • x-vector余弦距离与主观相似度MOS高度相关,验证了其作为说话人相似度客观度量的有效性。
  • 该方法在跨语言说话人相似度上的提升幅度大于语言内相似度,证实了跨语言损失目标的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。