Skip to main content
QUICK REVIEW

[论文解读] iSEGAN: Improved Speech Enhancement Generative Adversarial Networks

Deepak Baby|arXiv (Cornell University)|Feb 20, 2020
Speech and Audio Processing参考文献 31被引用 9
一句话总结

该论文提出 iSEGAN,一种用于端到端语音增强的改进型条件生成对抗网络(cGAN)框架,通过使用实例归一化替代虚拟批归一化,应用单边标签平滑,并集成可学习的 Gammatone 听觉滤波与预加重层。这些改进稳定了训练过程,降低了计算成本,并在 STOI 和 PESQ 等关键指标上实现了最先进性能,优于基于 VBN 的 GAN 模型以及强大的 LSTM-IRM 基线模型。

ABSTRACT

Popular neural network-based speech enhancement systems operate on the magnitude spectrogram and ignore the phase mismatch between the noisy and clean speech signals. Conditional generative adversarial networks (cGANs) show promise in addressing the phase mismatch problem by directly mapping the raw noisy speech waveform to the underlying clean speech signal. However, stabilizing and training cGAN systems is difficult and they still fall short of the performance achieved by the spectral enhancement approaches. This paper investigates whether different normalization strategies and one-sided label smoothing can further stabilize the cGAN-based speech enhancement model. In addition, we propose incorporating a Gammatone-based auditory filtering layer and a trainable pre-emphasis layer to further improve the performance of the cGAN framework. Simulation results show that the proposed approaches improve the speech enhancement performance of cGAN systems in addition to yielding improved stability and reduced computational effort.

研究动机与目标

  • 解决用于语音增强的条件生成对抗网络(cGAN)训练过程中存在的不稳定性与高计算成本问题。
  • 通过直接将原始含噪波形映射到干净波形,克服基于幅度谱图方法中的相位失配问题。
  • 通过架构与归一化技术的创新,提升基于 cGAN 的语音增强性能。
  • 探究受听觉启发的层(Gammatone 滤波、预加重)对模型稳定性和增强质量的影响。

提出的方法

  • 在判别器中用实例归一化(IN)替代虚拟批归一化(VBN),以减少内存占用与训练时间开销。
  • 应用单边标签平滑以稳定对抗训练过程并提升收敛性。
  • 在生成器与判别器中均引入可学习的 Gammatone 滤波器组层,以模拟人类听觉处理机制。
  • 集成可学习的预加重层以增强高频分量并提升训练稳定性。
  • 采用条件生成对抗网络框架,其中生成器将含噪波形与随机噪声联合映射为干净波形,且该过程受输入条件控制。
  • 采用生成器与判别器之间的最小最大对抗训练目标,并在波形输出上引入 L1 损失。

实验结果

研究问题

  • RQ1与虚拟批归一化相比,实例归一化是否能稳定并加速用于语音增强的 cGAN 训练?
  • RQ2单边标签平滑是否能提升基于 cGAN 的语音增强模型的稳定性与性能?
  • RQ3集成可学习的 Gammatone 滤波器组与预加重层是否能提升模型性能与稳定性?
  • RQ4引入潜在噪声向量是否有助于或阻碍模型学习干净语音表征的能力?
  • RQ5基于 cGAN 的方法是否能超越传统的基于幅度谱增强的方法(如 LSTM-IRM 基线)?

主要发现

  • 采用实例归一化与单边标签平滑的 iSEGAN 模型在 STOI 指标上达到 0.939,PESQ 指标达到 2.60,优于 LSTM-IRM 基线模型。
  • 使用实例归一化相比基于 VBN 的 SEGAN 模型,显著缩短了训练时间并提升了性能。
  • 加入可学习的 Gammatone 滤波与预加重层后,性能进一步提升,尤其在稳定性和主观可懂度方面表现突出。
  • 包含全部组件(IN + 标签平滑 + GT + 预加重)的模型在 STOI 上达到 0.939,PESQ 为 2.60,但训练过程不稳定,表明不同平衡状态之间存在权衡。
  • 潜在向量被证实对性能有积极贡献,若将其移除则导致训练不稳定且无法收敛。
  • 所提出的 cGAN 框架是首个在语音增强任务中超越强大 IRM 基线的模型,展现出其在端到端系统中的巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。