Skip to main content
QUICK REVIEW

[论文解读] Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding

Seungwoo Choi, Seungju Han|arXiv (Cornell University)|May 18, 2020
Speech Recognition and Synthesis参考文献 31被引用 8
一句话总结

Attentron 提出了一种少样本文本到语音模型,通过采用双编码器架构,仅使用少量参考音频样本即可克隆未见过的说话人:一个基于注意力的细粒度编码器用于建模可变长度风格,一个粗粒度编码器用于全局稳定性。该模型在说话人相似度和语音质量方面达到最先进性能,尤其在使用多个参考输入时表现更优,在客观评估和人工评估中均优于先前方法。

ABSTRACT

On account of growing demands for personalization, the need for a so-called few-shot TTS system that clones speakers with only a few data is emerging. To address this issue, we propose Attentron, a few-shot TTS model that clones voices of speakers unseen during training. It introduces two special encoders, each serving different purposes. A fine-grained encoder extracts variable-length style information via an attention mechanism, and a coarse-grained encoder greatly stabilizes the speech synthesis, circumventing unintelligible gibberish even for synthesizing speech of unseen speakers. In addition, the model can scale out to an arbitrary number of reference audios to improve the quality of the synthesized speech. According to our experiments, including a human evaluation, the proposed model significantly outperforms state-of-the-art models when generating speech for unseen speakers in terms of speaker similarity and quality.

研究动机与目标

  • 解决仅使用少量参考音频样本对未见过的说话人进行文本到语音系统个性化的问题。
  • 克服单一全局说话人嵌入的局限性,后者无法捕捉详细发音风格,且在短参考语句下性能下降。
  • 设计一种无需微调的少样本 TTS 系统,可随多个参考音频输入扩展。
  • 通过引入粗粒度编码器提升合成稳定性和质量,防止输出不清晰。
  • 通过注意力机制实现可变长度嵌入学习,以保留来自多个参考输入的时间风格信息。

提出的方法

  • 该模型采用基于 Tacotron 2 的 TTS 框架,条件依赖于两种嵌入:来自细粒度编码器的可变长度嵌入和来自粗粒度编码器的全局嵌入。
  • 细粒度编码器应用缩放点积注意力,从多个参考音频输入中提取相关帧,生成保持时间风格信息的可变长度嵌入。
  • 粗粒度编码器通过聚合参考音频中的时间特征,生成单一全局嵌入,增强合成稳定性。
  • 解码器同时关注文本编码和拼接后的全局嵌入,而细粒度嵌入则被广播并用于条件化自回归频谱图生成。
  • 模型以端到端方式训练,采用多说话人 TTS 目标,推理阶段支持任意数量的参考样本。
  • 消融研究评估了每个组件的影响,包括粗粒度编码器、细粒度编码器和注意力机制。

实验结果

研究问题

  • RQ1一个少样本 TTS 系统是否能在不微调的情况下,仅使用少量参考音频样本克隆未见过的说话人?
  • RQ2与固定长度的全局嵌入相比,通过注意力机制实现的可变长度嵌入是否能提升说话人相似度和语音质量?
  • RQ3增加粗粒度编码器如何影响合成稳定性和可懂度?
  • RQ4多个参考音频样本是否能提升性能,且模型是否能有效扩展至更多输入?
  • RQ5与平均池化或自注意力相比,所提出的注意力机制在泛化到未见过的说话人方面表现如何?

主要发现

  • 当训练和推理均使用 8 个参考样本时,Attentron 在未见过的说话人上实现了 0.788 的说话人相似度和 11.67 的 MCD,显著优于基线方法。
  • 在训练时使用 8 个参考样本、推理时仅使用 1 个参考样本(Attentron(8-1))时,未见过说话人的说话人相似度达到 0.769,表明相比单参考基线,泛化能力更强。
  • 若移除粗粒度编码器,未见过说话人将出现 143 次注意力崩溃事件,说话人相似度下降至 0.738,表明合成过程存在不稳定性。
  • 若将细粒度编码器替换为平均池化或自注意力,未见过说话人的相似度分别降至 0.751 和 0.755,表明注意力机制生成的可变长度嵌入具有必要性。
  • 在 'Encoded value' 变体中,通过卷积和 LSTM 层修改注意力值,未见过说话人的相似度降至 0.754,表明直接操纵原始注意力特征存在过拟合风险。
  • Attentron(8-8) 实现了最佳整体性能,表明在训练和推理阶段均使用多个参考样本可最大化质量与稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。