Skip to main content
QUICK REVIEW

[论文解读] Neural Sequence-to-Sequence Speech Synthesis Using a Hidden Semi-Markov Model Based Structured Attention Mechanism

Yoshihiko Nankaku, Kenta Sumiya|arXiv (Cornell University)|Aug 31, 2021
Speech Recognition and Synthesis参考文献 10被引用 4
一句话总结

该论文提出了一种新颖的端到端序列到序列语音合成模型,将隐半马尔可夫模型(HSMMs)整合到变分自编码器(VAE)框架内的结构化注意力机制中。通过将对齐作为具有显式时长建模的潜在变量,该方法实现了单调且时长感知的注意力机制,从而在小规模训练数据集上表现出更高的自然度和鲁棒性,在主观评价中优于Tacotron 2,取得更高的平均意见得分(MOS)。

ABSTRACT

This paper proposes a novel Sequence-to-Sequence (Seq2Seq) model integrating the structure of Hidden Semi-Markov Models (HSMMs) into its attention mechanism. In speech synthesis, it has been shown that methods based on Seq2Seq models using deep neural networks can synthesize high quality speech under the appropriate conditions. However, several essential problems still have remained, i.e., requiring large amounts of training data due to an excessive degree for freedom in alignment (mapping function between two sequences), and the difficulty in handling duration due to the lack of explicit duration modeling. The proposed method defines a generative models to realize the simultaneous optimization of alignments and model parameters based on the Variational Auto-Encoder (VAE) framework, and provides monotonic alignments and explicit duration modeling based on the structure of HSMM. The proposed method can be regarded as an integration of Hidden Markov Model (HMM) based speech synthesis and deep learning based speech synthesis using Seq2Seq models, incorporating both the benefits. Subjective evaluation experiments showed that the proposed method obtained higher mean opinion scores than Tacotron 2 on relatively small amount of training data.

研究动机与目标

  • 解决标准序列到序列模型在神经网络TTS中因注意力自由度过高而导致的数据需求量大、对齐鲁棒性差的问题。
  • 将显式时长建模整合到神经序列到序列语音合成中,以提升控制力与生成质量。
  • 结合基于HMM的语音合成(结构化对齐与时长建模)与深度学习驱动的序列到序列模型的优势。
  • 利用VAE框架同时优化对齐与模型参数,以提升泛化能力,尤其是在训练数据有限的情况下。

提出的方法

  • 基于变分自编码器(VAE)构建生成模型,其中文本与语音序列之间的对齐被表示为使用HSMM结构的潜在变量。
  • 通过时长分布 $ p(d_k \mid \xi_k, \eta_k^2) $ 显式建模状态时长,其中 $ \xi_k $ 和 $ \eta_k^2 $ 由编码器预测。
  • 采用结构化注意力机制,解码器通过状态序列 $ \hat{\bm{z}} $ 关注编码器状态,该序列是在先验分布与编码器输出下最可能的状态序列。
  • 采用两阶段训练:首先使用DNN-HSMM预训练编码器,然后使用VAE目标联合微调整个模型。
  • 在训练过程中应用引导注意力损失(g=0.2),以促进单调对齐,减少注意力过拟合。
  • 在VAE框架中使用共享先验与时长编码器,实现对齐与声学生成的联合优化。

实验结果

研究问题

  • RQ1将HSMM结构整合到序列到序列模型的注意力机制中,是否能提升对齐鲁棒性并降低数据依赖性?
  • RQ2在神经TTS系统中引入显式时长建模,是否能提升合成语音的自然度与可控性?
  • RQ3基于VAE的框架能否同时优化对齐与模型参数,以提升小样本训练数据集上的泛化能力?
  • RQ4在数据受限条件下,该方法与Tacotron 2及DNN-HSMM相比,在主观语音质量方面表现如何?
  • RQ5基于HSMM的结构化注意力在多大程度上提升了对齐的单调性并减少了注意力过拟合?

主要发现

  • 在主观评价中,该方法在自然度方面取得了最高的平均意见得分(MOS),优于Tacotron 2与DNN-HSMM。
  • 在仅450句的小型训练数据集上,该模型的对齐质量优于Tacotron 2,后者因注意力自由度过高而出现注意力过拟合。
  • 通过利用结构化注意力与显式时长建模,该方法在数据稀缺条件下表现出强鲁棒性,实现了高质量的语音合成。
  • 该模型优于FRAME(使用相同解码器结构),表明通过VAE实现对齐与参数的联合优化是有效的。
  • HSMM-based结构化注意力的引入使整个序列的对齐保持单调且一致,提升了训练稳定性与泛化能力。
  • 在VAE框架中使用共享先验与时长编码器,实现了对对齐与声学建模均有改进的有效端到端训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。