[论文解读] Parallel WaveNet conditioned on VAE latent vectors
本文提出通过使用预训练变自编码器(VAE)提取的潜在向量来条件化并行WaveNet神经声码器,以提升从预测的梅尔频谱图生成语音的质量。通过在训练过程中使用话语级别的VAE潜在向量,模型能够更好地重建自然语音,在不增加推理延迟的情况下实现统计上显著的质量提升,因为推理时可使用相同的固定均值向量。
Recently the state-of-the-art text-to-speech synthesis systems have shifted to a two-model approach: a sequence-to-sequence model to predict a representation of speech (typically mel-spectrograms), followed by a 'neural vocoder' model which produces the time-domain speech waveform from this intermediate speech representation. This approach is capable of synthesizing speech that is confusable with natural speech recordings. However, the inference speed of neural vocoder approaches represents a major obstacle for deploying this technology for commercial applications. Parallel WaveNet is one approach which has been developed to address this issue, trading off some synthesis quality for significantly faster inference speed. In this paper we investigate the use of a sentence-level conditioning vector to improve the signal quality of a Parallel WaveNet neural vocoder. We condition the neural vocoder with the latent vector from a pre-trained VAE component of a Tacotron 2-style sequence-to-sequence model. With this, we are able to significantly improve the quality of vocoded speech.
研究动机与目标
- 提升神经声码器在从预测的梅尔频谱图生成语音时的信号质量,因为预测误差常导致频谱图偏离自然语音。
- 解决神经声码器中推理速度与音频质量之间的权衡,尤其针对实时商业TTS应用。
- 探究通过VAE潜在向量进行全局条件化是否能弥合预测频谱图与自然频谱图之间的差距。
- 通过将条件向量计算与推理时间解耦,实现在不增加延迟的前提下实现高质量推理。
提出的方法
- 在Tacotron 2风格的系统中,使用预训练VAE编码器提取的句子级潜在向量来条件化并行WaveNet神经声码器。
- 采用教师-学生蒸馏框架:首先训练一个完整的自回归WaveNet作为教师模型,然后利用逆自回归流(IAFs)将教师模型的输出分布蒸馏到学生模型中,以实现并行推理。
- 训练学生模型以基于梅尔频谱图和VAE潜在向量预测IAF仿射参数,从而实现对频谱图和全局内容表征的联合建模。
- 在训练过程中,从声学模型的参考编码器中提取VAE潜在向量,并将其作为额外的条件信号,引导声码器生成更自然的语音波形。
- 在推理时,将动态VAE向量计算替换为从训练分布中获得的固定均值向量,从而在不增加延迟的情况下保持高质量输出。
- 使用主成分分析(PCA)可视化和MUSHRA测试评估不同潜在向量对语音合成质量的影响。
实验结果
研究问题
- RQ1在从预测的梅尔频谱图生成语音时,通过VAE潜在向量条件化并行WaveNet声码器是否能显著提升语音质量?
- RQ2推理时潜在向量的选择是否影响质量?是否可以使用一个固定的代表性向量(例如训练分布的均值)而不损失性能?
- RQ3当潜在向量远超出训练分布时会发生什么情况?模型是否会变得不稳定?
- RQ4该条件化方法是否可应用于能够跨说话人和风格泛化的通用声码器?
- RQ5VAE组件的预训练是否必要?还是可以与声码器联合学习全局表征?
主要发现
- 通过VAE潜在向量条件化并行WaveNet声码器,在MUSHRA评分上实现了统计上显著的提升,得分较基线提升1至1.5分。
- 基线系统与VAE条件化系统之间的t检验p值小于0.05,证实性能提升具有统计显著性。
- 在不同潜在向量条件下的MUSHRA评分无显著差异(p > 0.05),表明只要推理时使用的向量位于训练分布内,其具体选择对性能影响不大。
- 当使用远超出训练分布的潜在向量进行条件化时,模型仅输出噪声,表明模型对分布外输入敏感。
- 该方法在不增加推理延迟的前提下实现了更高质量的语音合成,因为可直接使用训练分布的固定均值向量,而无需在推理时动态计算VAE向量。
- 结果表明,VAE潜在向量作为全局先验,有助于声码器更好地重建自然语音,尤其在表现力强的语音中,通过使模型输出更贴近自然语音空间而提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。