[论文解读] Expressive Speech Synthesis via Modeling Expressions with Variational Autoencoder
该论文提出 VAE-Loop,一种新颖的框架,通过将变分自编码器(VAE)与自回归 VoiceLoop 模型结合,对全局语音特征(如说话人身份和语调风格)进行建模,从而提升语音合成的表达性,且无需使用带标签的表达数据。通过学习解耦的潜在空间,该方法实现了对语音表达性的无监督控制,并提升了语音质量,在 VCTK 数据集上达到与监督基线相当的 MOS 分数,在 Blizzard2012 数据集上则表现出更优的稳定性,当潜在先验方差受到约束时尤为显著。
Recent advances in neural autoregressive models have improve the performance of speech synthesis (SS). However, as they lack the ability to model global characteristics of speech (such as speaker individualities or speaking styles), particularly when these characteristics have not been labeled, making neural autoregressive SS systems more expressive is still an open issue. In this paper, we propose to combine VoiceLoop, an autoregressive SS model, with Variational Autoencoder (VAE). This approach, unlike traditional autoregressive SS systems, uses VAE to model the global characteristics explicitly, enabling the expressiveness of the synthesized speech to be controlled in an unsupervised manner. Experiments using the VCTK and Blizzard2012 datasets show the VAE helps VoiceLoop to generate higher quality speech and to control the expressions in its synthesized speech by incorporating global characteristics into the speech generating process.
研究动机与目标
- 解决自回归语音合成模型在不依赖带标签表达数据的情况下提升表达性的挑战。
- 实现在端到端语音合成中对全局语音特征(如说话人身份、性别和语调风格)的无监督建模。
- 通过在 VAE 中引入全局特征的潜在表示,提升自回归模型的语音质量与鲁棒性。
- 证明 VAE 学习到的潜在变量可用于控制和插值不同表达风格之间的合成语音。
- 在真实世界数据集(如 VCTK 和 Blizzard2012)上,验证所提方法在零样本和半监督设置下的有效性。
提出的方法
- 该方法将 VoiceLoop(一种自回归语音合成模型)与变分自编码器(VAE)结合,以在解耦的潜在空间中建模全局语音特征。
- VAE 从原始音频中学习潜在变量的后验分布,将说话人身份和语调等全局属性编码为紧凑且连续的表示。
- 推理阶段,潜在变量 z 从先验分布 p(z) = N(0, σ²I) 中采样,通过调节 σ 或在 z 向量之间插值,实现对表达特性的控制。
- VoiceLoop 将采样的 z 作为条件上下文,引导声学特征的自回归生成,实现风格感知的语音合成。
- 模型通过联合损失函数进行端到端训练,损失函数包含重建损失(MSE)和 VAE 的 KL 散度,确保生成质量与潜在空间的解耦性。
- 该方法支持在潜在表示之间插值,以生成具有中间表达特征(如音高或情感语调)的语音。
实验结果
研究问题
- RQ1VAE 能否有效用于无监督建模表达性语音合成中的全局语音特征?
- RQ2在不使用带标签表达数据的情况下,引入 VAE 学习到的潜在变量是否能提升自回归语音合成的质量与稳定性?
- RQ3VAE 学习到的潜在空间是否可用于控制和插值不同语调风格或说话人身份?
- RQ4潜在变量先验分布的方差如何影响合成语音的可懂度与质量?
- RQ5所提方法在多大程度上可达到或超越监督模型在表达性语音合成中的性能?
主要发现
- 在 VCTK 数据集上,VAE-Loop 的平均意见得分(MOS)为 3.25 ± 0.29,与使用说话人标签的 VoiceLoop 性能相当,且优于无标签的基线 VoiceLoop。
- 在 Blizzard2012 数据集上,将先验方差降低至 σ = 0.7 后,MOS 提升至 2.89 ± 0.32,超过基线并减少了语音不可懂的生成。
- 在两个 z 向量之间进行潜在变量插值,生成了中间的 F0 轨迹,证明了模型能够平滑地插值不同语调风格或说话人特征。
- VAE-Loop 模型在无标签条件下生成的语音质量优于基线 VoiceLoop,表明通过 VAE 学习到的全局特征可有效提升自回归生成过程。
- 当先验方差受到约束时,模型显著减少了不可懂输出(如气息噪声或重复音素)的发生。
- 不同 z 值对应的 F0 轨迹显示出明显不同的音高模式——如高音调女性风格与低音调男性风格——证实潜在空间成功解耦了表达性属性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。