[论文解读] LP-WaveNet: Linear Prediction-based WaveNet Speech Synthesis
本文提出 LP-WaveNet,一种基于 WaveNet 的神经声码器,通过在混合密度网络(MDN)中联合建模语音激励与线性预测(LP)滤波器响应,以提升语音合成质量。通过建模残差激励并结合 LP 合成约束,该方法减少了频谱失配和噪声伪影,在 TTS 评估中达到 4.47 的 MOS 分数,显著优于传统 WaveNet 声码器。
We propose a linear prediction (LP)-based waveform generation method via WaveNet vocoding framework. A WaveNet-based neural vocoder has significantly improved the quality of parametric text-to-speech (TTS) systems. However, it is challenging to effectively train the neural vocoder when the target database contains massive amount of acoustical information such as prosody, style or expressiveness. As a solution, the approaches that only generate the vocal source component by a neural vocoder have been proposed. However, they tend to generate synthetic noise because the vocal source component is independently handled without considering the entire speech production process; where it is inevitable to come up with a mismatch between vocal source and vocal tract filter. To address this problem, we propose an LP-WaveNet vocoder, where the complicated interactions between vocal source and vocal tract components are jointly trained within a mixture density network-based WaveNet model. The experimental results verify that the proposed system outperforms the conventional WaveNet vocoders both objectively and subjectively. In particular, the proposed method achieves 4.47 MOS within the TTS framework.
研究动机与目标
- 解决在大规模、多样化语音数据库上训练神经声码器时面临的高语调与表现力可变性挑战。
- 减少因独立建模激励而导致的 WaveNet 基语音合成中的频谱失配与噪声伪影。
- 通过将语音产生过程的物理机制——特别是声源与声道的相互作用——融入 WaveNet 的训练目标,提升感知质量。
- 通过将 LP 合成滤波嵌入生成模型,实现更稳定且高保真的波形生成。
提出的方法
- LP-WaveNet 使用混合密度网络(MDN)建模语音信号分布,将预测的激励均值与过去语音样本的 LP 近似相结合。
- 模型以过去语音样本和 LP 系数为条件,确保生成信号符合 LP 合成滤波器的动力学特性。
- 激励分量由 WaveNet 自回归建模,而 LP 近似则通过加权过去样本的线性组合计算得出,权重为 LP 系数。
- 目标分布定义为 MDN 均值与 LP 近似的和,实现激励与频谱包络的联合学习。
- 通过建模残差信号避免粗粒度量化,减少标准 WaveNet 中常见的噪声伪影。
- 该框架通过将复杂频谱建模任务交由 LP 近似处理,使 WaveNet 专注于激励预测,从而实现高效训练。
实验结果
研究问题
- RQ1与独立激励建模相比,联合建模激励与 LP 合成滤波是否能提升语音合成质量?
- RQ2将 LP 合成过程融入 WaveNet 训练目标是否能减少频谱失配与噪声伪影?
- RQ3与标准 WaveNet 和仅激励建模的 WaveNet 声码器相比,LP-WaveNet 在客观指标与主观 MOS 评估中的表现如何?
- RQ4当声学特征由 TTS 系统预测时(即存在特征预测误差),该方法是否仍能保持高质量?
- RQ5在 A-B 偏好测试中,LP-WaveNet 的感知质量是否显著优于基线 WaveNet 声码器?
主要发现
- 在 TTS 框架中,LP-WaveNet 达到 4.47 的平均意见分(MOS),显著优于次优系统(4.04),并接近自然语音(4.75 MOS)。
- 在 A/S 系统中,LP-WaveNet 达到 4.58 MOS,仅比自然语音低 0.17 分,表明其已达到接近自然语音的质量水平。
- A-B 偏好测试显示,LP-WaveNet 在所有测试条件下均显著优于 WN_S 与 WN_E(p < 10^-4),多个比较中的偏好率超过 80%。
- 客观指标显示,LP-WaveNet 在所有指标上均优于传统 WaveNet 声码器,包括 VUV 错误率、F0 RMSE、LSD 与 F-LSD。
- 即使在 TTS 系统中存在声学特征预测误差的情况下,LP-WaveNet 仍保持优越性能,表明其对特征退化具有鲁棒性。
- 该方法通过在 MDN 框架内联合建模激励与 LP 滤波器相互作用,有效减少了噪声伪影与频谱失配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。