Skip to main content
QUICK REVIEW

[论文解读] On Loss Functions and Recurrency Training for GAN-based Speech Enhancement Systems

Zhuohuang Zhang, Chengyun Deng|arXiv (Cornell University)|Jul 29, 2020
Speech and Audio Processing参考文献 35被引用 8
一句话总结

该论文提出了一种用于语音增强的卷积循环生成对抗网络(CRGAN),结合了卷积神经网络(CNN)以捕捉局部频时相关性,以及双向长短期记忆(BiLSTM)层以建模长期时序依赖。通过使用包含均方误差(MSE)的度量损失,该模型在PESQ、STOI、CSIG、CBAK和COVL等指标上均达到最先进性能,最佳配置下的PESQ为2.92,STOI为0.940。

ABSTRACT

Recent work has shown that it is feasible to use generative adversarial networks (GANs) for speech enhancement, however, these approaches have not been compared to state-of-the-art (SOTA) non GAN-based approaches. Additionally, many loss functions have been proposed for GAN-based approaches, but they have not been adequately compared. In this study, we propose novel convolutional recurrent GAN (CRGAN) architectures for speech enhancement. Multiple loss functions are adopted to enable direct comparisons to other GAN-based systems. The benefits of including recurrent layers are also explored. Our results show that the proposed CRGAN model outperforms the SOTA GAN-based models using the same loss functions and it outperforms other non-GAN based systems, indicating the benefits of using a GAN for speech enhancement. Overall, the CRGAN model that combines an objective metric loss function with the mean squared error (MSE) provides the best performance over comparison approaches across many evaluation metrics.

研究动机与目标

  • 探究在GAN框架中结合卷积与循环架构是否能提升语音增强性能。
  • 评估不同损失函数对基于GAN的语音增强系统的影响。
  • 确定基于GAN框架的对抗训练是否相较于非GAN基线具有优势。
  • 量化循环层在基于GAN的语音增强模型中的贡献。
  • 确定CRGAN语音增强的最佳损失函数配置。

提出的方法

  • 提出一种新型CRGAN架构,采用编码器-解码器结构,结合2D卷积层与双向长短期记忆(BiLSTM)层,以建模局部与长期语音依赖关系。
  • 整合多种损失函数,包括相对平均(Ra)、度量损失与均方误差(MSE),用于训练生成器与判别器。
  • 采用两阶段对抗训练流程:首先在真实(理想)掩码与生成的虚假掩码上训练判别器;随后训练生成器以欺骗判别器。
  • 通过将单向LSTM替换为BiLSTM,扩展CRN架构,以提升生成器中的时序建模能力。
  • 采用结合度量损失与MSE的混合损失,以增强感知质量与重建精度。
  • 评估消融变体:无循环层的CRGAN与仅使用单一损失函数的CRGAN,以分离各组件的贡献。

实验结果

研究问题

  • RQ1在基于GAN的语音增强模型中引入循环层是否能相比纯卷积GAN提升性能?
  • RQ2哪种损失函数组合在语音质量与可懂度方面表现最佳?
  • RQ3CRGAN系统是否能超越现有最先进非GAN基线模型?
  • RQ4基于GAN框架的对抗训练与非GAN训练相比,在增强质量方面表现如何?
  • RQ5在CRGAN架构中,循环层对语音增强的相对贡献是什么?

主要发现

  • M-CRGAN-MSE模型在PESQ上达到最高分2.92,在STOI上达到0.940,优于所有其他基于GAN与非GAN的系统。
  • 采用度量损失与MSE的CRGAN在CSIG(4.16)、CBAK(3.24)与COVL(3.54)上表现更优,表明语音保真度更高且噪声干扰更少。
  • 移除循环层导致性能显著下降,PESQ从2.92(M-CRGAN-MSE)降至2.38(Ra-CGAN),证实了时序建模的重要性。
  • CRGAN优于现有最佳基于GAN的系统(RaSGAN,PESQ: 2.57)与非GAN基线(如BiLSTM,PESQ: 2.70),证明了对抗训练与合理架构的协同优势。
  • 度量损失与MSE结合的配置在所有指标上均带来最一致的性能提升,表明其是最适合CRGAN语音增强的损失函数。
  • 采用相对平均损失(Ra-CRGAN)的CRGAN模型取得PESQ 2.81与STOI 0.936,表现强劲但仍低于M-CRGAN-MSE变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。