[论文解读] A Deep Learning Approach to Data-driven Parameterizations for Statistical Parametric Speech Synthesis
本文提出一种基于数据驱动的深度学习参数化方法,用于统计参数化语音合成,采用截断式堆叠去噪自编码器(SDA)学习一种可逆的、低维的、抗噪的梅尔对数谱编码。SDA 经展开并使用多层感知机(MLP)微调后,被拆分为独立的编码与解码网络。该方法在 MCD 指标上取得具有竞争力的表现(3.827),并证明所学表征位于可插值空间中,满足语音合成参数化所需的所有关键要求。
Nearly all Statistical Parametric Speech Synthesizers today use Mel Cepstral coefficients as the vocal tract parameterization of the speech signal. Mel Cepstral coefficients were never intended to work in a parametric speech synthesis framework, but as yet, there has been little success in creating a better parameterization that is more suited to synthesis. In this paper, we use deep learning algorithms to investigate a data-driven parameterization technique that is designed for the specific requirements of synthesis. We create an invertible, low-dimensional, noise-robust encoding of the Mel Log Spectrum by training a tapered Stacked Denoising Autoencoder (SDA). This SDA is then unwrapped and used as the initialization for a Multi-Layer Perceptron (MLP). The MLP is fine-tuned by training it to reconstruct the input at the output layer. This MLP is then split down the middle to form encoding and decoding networks. These networks produce a parameterization of the Mel Log Spectrum that is intended to better fulfill the requirements of synthesis. Results are reported for experiments conducted using this resulting parameterization with the ClusterGen speech synthesizer.
研究动机与目标
- 为解决统计参数化语音合成中长期存在的局限性:尽管已知缺陷,梅尔倒谱系数(MCEPs)仍是标准参数化方法。
- 开发一种满足四项关键要求的数据驱动参数化方法:可逆性、抗噪性、低维性与可插值性。
- 探究深度学习是否能发现优于人工设计参数化方法(如 MCEPs)的谱表示。
- 在真实合成器(ClusterGen)中评估所提方法,并与 MCEP 基线在定量与定性层面进行比较。
提出的方法
- 在梅尔对数谱特征上训练堆叠去噪自编码器(SDA),其中每一层通过注入噪声学习重建输入的损坏版本。
- 使用预训练的 SDA 权重作为初始化,对多层感知机(MLP)进行微调,使其在输出层重建原始输入。
- 将训练好的 MLP 展开为两个独立子网络:编码器(将输入映射到低维码)与解码器(将码映射回谱)。
- 所得编码设计为具备可逆性、低维性、抗噪性与可插值性——这些是语音合成的关键属性。
- 使用 ClusterGen 合成器与 SLT 语音进行评估,将 MCD 与主观质量与 MCEP 基线进行比较。
- 通过训练具有不同层维度的多种 SDA 架构,研究网络深度与宽度的影响。
实验结果
研究问题
- RQ1深度学习模型能否学习一种满足语音合成四项关键要求(可逆性、抗噪性、低维性、可插值性)的数据驱动参数化?
- RQ2与标准 MCEP 表示相比,基于 DNN 的参数化在谱重建(MCD)与主观质量方面的表现如何?
- RQ3网络深度与宽度对所学参数化质量有何影响?
- RQ4所学表征是否支持有效插值,这对基于聚类的合成系统(如 ClusterGen)至关重要。
- RQ5尽管 MCD 分数良好,为何基于 DNN 的方法在主观评价中表现较差?客观函数的选择在其中起到何种作用?
主要发现
- 所提 DNN 参数化方法在 SLT 语音上的梅尔倒谱失真(MCD)达到 3.827,与 MCEP 基线相比具有竞争力。
- 该方法成功生成可逆且抗噪的表征,SDA 的预训练有助于稳定学习低维特征。
- 所学编码位于可插值空间中,这通过 ClusterGen 合成器能有效利用其基于聚类的方法得到验证。
- 更深的网络(如 200x175x125x75x50)优于浅层网络,随着深度增加,MCD 从 4.315 降至 3.827,表明深度具有显著优势。
- 尽管 MCD 表现良好,主观质量仍略逊于 MCEPs,可能是因为训练过程中缺乏针对语音合成优化的客观函数。
- 在预训练中使用高斯噪声相比传统零掩码噪声会降低性能,表明噪声模型对学习过程有显著影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。