[论文解读] WaveCycleGAN2: Time-domain Neural Post-filter for Speech Waveform Generation
WaveCycleGAN2 提出了一种时域神经后处理滤波器,用于语音波形生成,通过移除下采样/上采样模块并结合波形与声学参数判别器,消除了混叠现象。该方法在单张 GPU 上实现超过 150 kHz 的音频处理速度,同时在自然度评分上与 WaveNet 和 WaveGlow 相当。
WaveCycleGAN has recently been proposed to bridge the gap between natural and synthesized speech waveforms in statistical parametric speech synthesis and provides fast inference with a moving average model rather than an autoregressive model and high-quality speech synthesis with the adversarial training. However, the human ear can still distinguish the processed speech waveforms from natural ones. One possible cause of this distinguishability is the aliasing observed in the processed speech waveform via down/up-sampling modules. To solve the aliasing and provide higher quality speech synthesis, we propose WaveCycleGAN2, which 1) uses generators without down/up-sampling modules and 2) combines discriminators of the waveform domain and acoustic parameter domain. The results show that the proposed method 1) alleviates the aliasing well, 2) is useful for both speech waveforms generated by analysis-and-synthesis and statistical parametric speech synthesis, and 3) achieves a mean opinion score comparable to those of natural speech and speech synthesized by WaveNet (open WaveNet) and WaveGlow while processing speech samples at a rate of more than 150 kHz on an NVIDIA Tesla P100.
研究动机与目标
- 解决自然语音与合成语音波形之间的持久差距,特别是由声码器伪影和相位模糊性引起的差异。
- 克服先前 WaveCycleGAN 模型中下采样/上采样模块导致的混叠失真。
- 提升分析-合成与统计参数化语音合成流程的语音质量。
- 在保持与最先进自回归模型和流模型相当的感知质量的前提下,实现超过 150 kHz 的高速推理。
- 通过在时域中采用循环一致性对抗学习,实现在无需并行训练数据的情况下高质量语音转换。
提出的方法
- 提出一种完全卷积的生成器架构,不包含任何下采样或上采样层,以彻底消除混叠伪影。
- 引入双判别器设置:一个作用于原始波形,另一个作用于声学参数(梅尔谱、梅尔倒谱、相位谱)。
- 采用循环一致性对抗训练,学习从合成到自然语音波形的映射,无需成对训练数据。
- 利用波形域判别器保留精细的时间细节,同时利用声学参数判别器对齐频谱特征。
- 在成对(V2msp paired)和非成对(V2msp unpaired)设置下联合训练模型,以增强在多样化输入条件下的泛化能力。
- 利用循环一致性学习对相位模糊性的不变性,避免训练过程中产生静音或损坏输出。
实验结果
研究问题
- RQ1在生成器中移除下采样/上采样模块是否能显著减少后处理语音波形中的混叠现象?
- RQ2在波形域和声学参数域同时使用判别器是否能提升感知质量与泛化能力?
- RQ3所提方法是否能在保持高速推理的同时,实现与 WaveNet 和 WaveGlow 相当的自然度评分?
- RQ4该模型在不同语音合成流程(包括分析-合成与统计参数化合成)中的表现如何?
- RQ5在无并行数据的非成对训练设置下,其语音质量与鲁棒性是否与成对设置相当?
主要发现
- WaveCycleGAN2 通过在生成器架构中完全移除下采样/上采样模块,显著减少了混叠伪影。
- 在 LJSpeech 数据集的成对设置下,模型取得 4.023 ± 0.124 的平均意见得分(MOS),优于开放版 WaveNet(3.657 ± 0.162)和 WaveGlow(3.443 ± 0.164)。
- 在 LJSpeech 数据集上,V2msp(成对)的对数谱失真(LSD)为 4.318 dB,优于 WaveGlow(4.540 dB)和开放版 WaveNet(4.971 dB)。
- 非成对训练变体(V2msp unpaired)取得 3.833 ± 0.127 的 MOS,表明其在无并行数据条件下仍具备强大的泛化能力。
- 该模型在 NVIDIA Tesla P100 上实现超过 150 kHz 的音频处理速度,支持实时推理,适用于实际部署。
- 主观评估显示,WaveCycleGAN2 减少了 WaveGlow(如预回声)和开放版 WaveNet(如崩溃现象)中常见的伪影,但部分伪影仍因 WORLD 声码器的音节检测错误而存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。