Skip to main content
QUICK REVIEW

[论文解读] AdaDurIAN: Few-shot Adaptation for Neural Text-to-Speech with DurIAN

Zewang Zhang, Qiao Tian|arXiv (Cornell University)|May 12, 2020
Natural Language Processing Techniques参考文献 27被引用 22
一句话总结

AdaDurIAN 提出了一种基于改进的 DurIAN 平均模型的 few-shot 适应方法,用于神经文本转语音,仅需几分钟的单语数据即可实现高质量、自然且与说话人相似的语音合成。通过仅微调说话人嵌入和解码器,而保持内容编码器固定,该方法在自然度(使用 3 分钟数据时 MOS 为 4.21)和跨语言鲁棒性方面均优于基线 Tacotron 类模型。

ABSTRACT

This paper investigates how to leverage a DurIAN-based average model to enable a new speaker to have both accurate pronunciation and fluent cross-lingual speaking with very limited monolingual data. A weakness of the recently proposed end-to-end text-to-speech (TTS) systems is that robust alignment is hard to achieve, which hinders it to scale well with very limited data. To cope with this issue, we introduce AdaDurIAN by training an improved DurIAN-based average model and leverage it to few-shot learning with the shared speaker-independent content encoder across different speakers. Several few-shot learning tasks in our experiments show AdaDurIAN can outperform the baseline end-to-end system by a large margin. Subjective evaluations also show that AdaDurIAN yields higher mean opinion score (MOS) of naturalness and more preferences of speaker similarity. In addition, we also apply AdaDurIAN to emotion transfer tasks and demonstrate its promising performance.

研究动机与目标

  • 为解决在极少量单语数据下为新说话人训练高质量神经 TTS 系统的挑战。
  • 通过利用时序感知注意力机制和共享的说话人无关内容编码器,提升 few-shot 说话人适应中的鲁棒性和自然度。
  • 仅使用几分钟数据,实现在新说话人语音中的流畅跨语言语音合成,克服基于注意力的端到端 TTS 模型的不稳定性。
  • 在说话人适应和 few-shot 情绪迁移任务中评估模型性能。

提出的方法

  • 提出 AdaDurIAN,一种基于 DurIAN 的 few-shot 适应框架,采用共享的说话人无关内容编码器,用于音素和声调/重音序列的处理。
  • 固定内容编码器,仅微调说话人嵌入和解码器头,降低训练不稳定性并减少发音错误。
  • 引入时间延迟的 LSTM 后处理网络以支持流式推理,替代全局 CBHG 模块,提升梅尔频谱图的平滑性。
  • 采用带时序监督的窗口化内容注意力机制,增强对齐鲁棒性并减少注意力坍塌。
  • 训练一个多说话人平均模型,并通过仅 1–20 分钟单语数据每说话人进行微调实现适应。
  • 将相同的适应策略应用于情绪迁移任务,从一个中性基础模型中仅用极少数据迁移情绪。

实验结果

研究问题

  • RQ1能否仅使用几分钟的单语数据,有效将单一平均 TTS 模型适应到新说话人,同时保持高自然度和说话人相似度?
  • RQ2在 few-shot 场景下,仅微调说话人嵌入和解码器而固定内容编码器,对发音准确性和对齐鲁棒性有何影响?
  • RQ3当目标说话人在目标语言中无任何先验数据时,AdaDurIAN 在跨语言语音合成中的泛化能力如何?
  • RQ4AdaDurIAN 能否成功应用于 few-shot 情绪迁移任务?其在不同情绪风格下的性能表现如何?
  • RQ5与标准 Tacotron 类模型相比,AdaDurIAN 在 MOS、说话人相似度和跨语言流畅性方面的表现如何?

主要发现

  • 仅使用 3 分钟训练数据,AdaDurIAN 在母语中文说话人上达到 4.21 的 MOS,仅比真实录音的 MOS 低 0.2。
  • 对于无中文数据的母语英语说话人,AdaDurIAN 仅用 1 分钟数据在中文句子上即达到 3.90 的 MOS,展现出强大的跨语言泛化能力。
  • 在说话人相似度偏好测试中,AdaDurIAN 显著优于 SMA 基线,尤其在英语句子中对中文说话人表现更优。
  • 在 few-shot F2F 情绪迁移中,模型实现了 64% 的平均情绪分类准确率,在 F2M 迁移中达到 52%,表明在极少数据下情绪迁移性能优异。
  • 主观评估证实,与基线 Tacotron 类模型相比,AdaDurIAN 在自然度和说话人相似度偏好方面均表现更优。
  • 通过固定内容编码器并仅微调说话人嵌入和解码器,该方法显著减少了发音错误和注意力坍塌。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。