[论文解读] TFGAN: Time and Frequency Domain Based Generative Adversarial Network for High-fidelity Speech Synthesis
TFGAN 提出了一种时间域与频域联合对抗生成模型,用于高质量语音合成,通过引入基于 ResNet18 的频域判别器以及多种时域波形损失,减少了金属感失真并提升了相位一致性,从而在保持接近 MelGAN 推理速度的同时,达到了与自回归模型 WaveRNN 相当的性能,MOS 得分为 4.35 ± 0.04,优于 MelGAN 并接近 WaveRNN 的质量水平。
Recently, GAN based speech synthesis methods, such as MelGAN, have become very popular. Compared to conventional autoregressive based methods, parallel structures based generators make waveform generation process fast and stable. However, the quality of generated speech by autoregressive based neural vocoders, such as WaveRNN, is still higher than GAN. To address this issue, we propose a novel vocoder model: TFGAN, which is adversarially learned both in time and frequency domain. On one hand, we propose to discriminate ground-truth waveform from synthetic one in frequency domain for offering more consistency guarantees instead of only in time domain. On the other hand, in contrast to the conventionally frequency-domain STFT loss approach or feature map loss by discriminator to learn waveform, we propose a set of time-domain loss that encourage the generator to capture the waveform directly. TFGAN has nearly same synthesis speed as MelGAN, but the fidelity is significantly improved by our novel learning method. In our experiments, TFGAN shows the ability to achieve comparable mean opinion score (MOS) than autoregressive vocoder under speech synthesis context.
研究动机与目标
- 为解决非自回归 GAN 语音合成器(如 MelGAN)中长期存在的金属感与相位相关失真问题。
- 通过在时间域与频域同时进行对抗训练,提升波形保真度,增强主观感知质量。
- 通过引入直接的时域波形损失,减少对 STFT 损失的依赖,实现对生成器更优的监督。
- 在保持 MelGAN 级别推理速度的同时,实现与自回归模型(如 WaveRNN)相当的合成质量。
- 设计更鲁棒的判别器架构,以更好地捕捉相位与频谱一致性。
提出的方法
- 引入基于 ResNet18 的频域判别器,评估时域与频域中 STFT 幅度与相位的真伪语音,提升相位一致性。
- 提出多种时域波形损失(如 L1、L2),直接对原始音频进行生成器监督,减少对 STFT 损失的过度依赖。
- 通过集成最近邻插值方式改进转置卷积上采样层,有效抑制浊音区域的周期性失真。
- 采用类似 Multi-band MelGAN 的多尺度时域判别器,通过不同尺度的步长大卷积捕捉局部与全局音频结构。
- 结合对抗损失、特征匹配损失与多分辨率 STFT 损失,稳定训练过程并提升频谱保真度。
- 采用双判别器结构:一个在时域,一个在频域,与生成器端到端联合训练。
实验结果
研究问题
- RQ1在时间域与频域同时进行对抗训练,是否能显著提升非自回归语音声码器的主观感知质量?
- RQ2与仅依赖 STFT 损失相比,引入直接的时域波形损失是否能有效减少金属感失真并提升相位一致性?
- RQ3基于 ResNet18 的频域判别器是否能比仅使用时域的判别器更好地捕捉频谱与相位特征?
- RQ4经过改进的上采样机制在语音合成中,特别是在浊音段,能否有效减少周期性失真?
- RQ5能否使基于 GAN 的声码器在保持 MelGAN 级别推理速度的同时,实现与自回归模型(如 WaveRNN)相当的 MOS 评分?
主要发现
- TFGAN 的平均意见得分(MOS)为 4.35 ± 0.04,优于 MelGAN(3.95 ± 0.05),并达到与自回归模型 Multi-band WaveRNN(4.34 ± 0.04)相当的水平。
- 消融实验表明,结合时域损失与改进的上采样方法后,PESQ 从基线的 2.77 提升至 3.24,超过 WaveRNN 的 3.02。
- 频域判别器显著提升了相位一致性,有效减少了金属感与人工听觉失真。
- 改进的上采样机制在客观指标验证下,有效降低了呼吸声与浊音区域的周期性失真。
- TFGAN 维持了与 MelGAN 相同的推理速度,在单张 GPU 上实现了约 0.01 的实时因子(RTF)。
- 模型在客观指标上达到 STOI 0.95 与 PESQ 3.24,优于 MelGAN 与 WaveRNN,其中 PESQ 比 WaveRNN 高出 0.22 分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。