[论文解读] Learning latent representations for style control and transfer in end-to-end speech synthesis
本文将变分自编码器(VAE)引入端到端TTS模型中,以无监督方式学习说话风格的解耦连续潜在表征。通过使用变分推断从参考语音中提取风格码并对其进行操作,该模型实现了精确的风格控制,并在平行与非平行风格迁移的ABX偏好测试中优于全局风格标记(GST)模型。
In this paper, we introduce the Variational Autoencoder (VAE) to an end-to-end speech synthesis model, to learn the latent representation of speaking styles in an unsupervised manner. The style representation learned through VAE shows good properties such as disentangling, scaling, and combination, which makes it easy for style control. Style transfer can be achieved in this framework by first inferring style representation through the recognition network of VAE, then feeding it into TTS network to guide the style in synthesizing speech. To avoid Kullback-Leibler (KL) divergence collapse in training, several techniques are adopted. Finally, the proposed model shows good performance of style control and outperforms Global Style Token (GST) model in ABX preference tests on style transfer.
研究动机与目标
- 在端到端文本到语音合成中实现无监督学习解耦的说话风格表征。
- 通过直接操作学习到的潜在变量实现细粒度的风格控制。
- 通过识别网络从参考语音中推断风格码,实现风格迁移。
- 在参考风格与目标风格显著不同的非平行风格迁移中提升泛化能力。
- 在语音合成背景下缓解VAE训练过程中的KL散度崩溃问题。
提出的方法
- 将VAE模块集成到Tacotron2 TTS框架中,以学习说话风格的连续潜在空间。
- 使用识别网络 $q_{oldsymbol{ heta}}( extbf{z}| extbf{x})$ 从参考语音输入中推断风格表征。
- 应用重参数化技巧,使变分自编码器编码器中的随机采样可反向传播。
- 采用权重共享和梯度惩罚等技术,防止训练过程中KL散度崩溃。
- 通过将推断出的潜在风格码 $\mathbf{z}$ 作为条件输入TTS解码器,实现风格迁移。
- 通过操作潜在向量 $\mathbf{z}$ 的各个维度,实现插值与解耦控制。
实验结果
研究问题
- RQ1VAE能否在端到端TTS系统中无监督地学习到解耦且可解释的说话风格潜在表征?
- RQ2所学习的潜在空间在多大程度上支持风格属性的连续插值与加法组合?
- RQ3所提出的基于VAE的风格表征是否在风格迁移性能上优于GST模型?
- RQ4当参考风格与目标风格来自不同说话人或条件时,该模型在非平行风格迁移中的泛化能力如何?
- RQ5该模型能否在无需成对参考数据的情况下实现高质量的风格控制?
主要发现
- 基于VAE的潜在空间可实现风格表征之间的平滑插值,导致音高、语速和语调的渐变变化。
- 潜在向量的各个维度分别控制特定的风格属性,如音高高度、局部音高变化和语速,体现出良好的解耦性。
- 在ABX偏好测试中,该模型表现优于GST模型,且在平行与非平行风格迁移中p值均小于10^-5。
- 在非平行风格迁移中,该模型展现出显著更好的泛化能力,表明对风格域偏移具有鲁棒性。
- 所学习的潜在表征支持直接操作以实现风格控制,并可通过从先验分布采样实现数据增强。
- 通过架构设计与训练技巧有效缓解了KL散度崩溃问题,确保了训练的稳定性与后验推理的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。