[论文解读] Fully-hierarchical fine-grained prosody modeling for interpretable speech synthesis
本文提出一种完全分层的、条件变分自编码器(VAE),将其与Tacotron 2结合,以在多个层级——话语、词和音素——上建模语调,通过潜在维度之间的分层条件控制实现。该方法实现了语调属性(F0、能量、时长)的更好解耦,定量结果表明,完全分层VAE的方差比达到11.5±2.3,优于基线模型,实现了可解释的、细粒度的语调控制。
This paper proposes a hierarchical, fine-grained and interpretable latent variable model for prosody based on the Tacotron 2 text-to-speech model. It achieves multi-resolution modeling of prosody by conditioning finer level representations on coarser level ones. Additionally, it imposes hierarchical conditioning across all latent dimensions using a conditional variational auto-encoder (VAE) with an auto-regressive structure. Evaluation of reconstruction performance illustrates that the new structure does not degrade the model while allowing better interpretability. Interpretations of prosody attributes are provided together with the comparison between word-level and phone-level prosody representations. Moreover, both qualitative and quantitative evaluations are used to demonstrate the improvement in the disentanglement of the latent dimensions.
研究动机与目标
- 通过在话语、词和音素等多个分层上建模语调,实现在神经文本到语音系统中的细粒度、可解释语调控制。
- 解决现有基于VAE的语调建模中潜在表征纠缠的问题,即各维度难以解释。
- 通过在潜在维度之间采用分层条件控制的条件VAE,提升语调属性(F0、能量、时长)的解耦性。
- 证明词层级语调控制比音素层级控制更能保持自然的语调结构,从而提升感知质量。
提出的方法
- 将分层VAE集成到Tacotron 2框架中,在话语、词和音素层级分别设置独立的潜在表征。
- 使用位置敏感注意力机制,将目标声谱图与音素层级表征对齐,实现音素层级语调的提取。
- 采用具有自回归结构的条件VAE,其中更细粒度的潜在表征以粗粒度特征为条件。
- 在潜在维度上施加训练调度,以强制语调属性学习的有序性:先能量,再时长,最后F0。
- 使用方差比分析对解耦性进行定量评估,测量某一语调属性的变异中有多少可归因于单一潜在维度。
- 结合定性MOS测试与定量方差比分析,比较不同采样层级(音素 vs. 词)下的解耦性与感知质量。
实验结果
研究问题
- RQ1分层的、多层级潜在变量模型能否提升神经TTS系统中语调表征的可解释性?
- RQ2在潜在维度之间采用分层条件控制,是否能实现对F0、能量和时长等语调属性的更好解耦?
- RQ3在感知自然度与语调结构保持方面,词层级语调控制与音素层级控制相比表现如何?
- RQ4训练调度能否在不同潜在维度上强制实现一致且可解释的语调属性学习顺序?
- RQ5所提出的完全分层VAE在解耦质量方面,与基线VAE和DIP-VAE相比,优势有多大?
主要发现
- 在LibriTTS数据集上,完全分层VAE的方差比达到11.5±2.3,显著优于基线细粒度VAE(7.5±1.0)和DIP-VAE I(9.9±1.9),表明语调属性解耦性更优。
- 对F0潜在维度进行词层级独立采样时,MOS得分达到3.91±0.10,高于音素层级采样(3.75±0.09),表明自然语调结构保持得更好。
- 训练调度稳定地实现了属性学习顺序:能量、时长、F0,与感知特性和重建性能一致。
- 首个潜在维度主要捕捉静音时长,证实模型学习到了有意义且可解释的表征。
- 该模型在保持重建性能的同时,实现了细粒度、可解释的控制,表现为在多个随机种子和数据集上均持续提升了解耦性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。