Skip to main content
QUICK REVIEW

[论文解读] Time-domain Speech Enhancement with Generative Adversarial Learning

Feiyang Xiao, Jian Guan|arXiv (Cornell University)|Mar 30, 2021
Speech and Audio Processing参考文献 29被引用 4
一句话总结

本文提出TSEGAN,一种时域语音增强框架,通过将度量评估集成到生成对抗网络中,以稳定训练并缓解由SI-SNR损失引起的尺度模糊性。通过使用通过SI-SNR评估语音质量的判别器,TSEGAN在客观性能和泛化能力方面优于基于WGAN的方法,且理论分析解释了为何度量GAN优于WGAN。

ABSTRACT

Speech enhancement aims to obtain speech signals with high intelligibility and quality from noisy speech. Recent work has demonstrated the excellent performance of time-domain deep learning methods, such as Conv-TasNet. However, these methods can be degraded by the arbitrary scales of the waveform induced by the scale-invariant signal-to-noise ratio (SI-SNR) loss. This paper proposes a new framework called Time-domain Speech Enhancement Generative Adversarial Network (TSEGAN), which is an extension of the generative adversarial network (GAN) in time-domain with metric evaluation to mitigate the scaling problem, and provide model training stability, thus achieving performance improvement. In addition, we provide a new method based on objective function mapping for the theoretical analysis of the performance of Metric GAN, and explain why it is better than the Wasserstein GAN. Experiments conducted demonstrate the effectiveness of our proposed method, and illustrate the advantage of Metric GAN.

研究动机与目标

  • 解决时域语音增强模型中由尺度不变信噪比(SI-SNR)损失引起的训练不稳定性问题。
  • 通过将度量评估集成到GAN框架中,提升语音增强模型的泛化能力和客观性能。
  • 为为何度量GAN在语音增强任务中优于WGAN提供理论解释。
  • 开发一个灵活的框架,支持多种TasNet-based生成器,用于时域语音增强。

提出的方法

  • 该框架使用基于TasNet的生成器,以在时域中学习噪声语音的潜在表征。
  • 引入一种度量评估判别器,用于估计增强语音与干净语音之间的SI-SNR,替代标准GAN损失。
  • 判别器被训练以输出与实际SI-SNR值对齐的分数,从而提供更稳定且有意义的训练信号。
  • 生成器通过一种损失函数进行优化,该函数鼓励增强语音获得较高的SI-SNR,同时受到度量判别器的引导。
  • 该方法被形式化为一种度量GAN,其中判别器的输出被约束为匹配客观度量(SI-SNR),从而确保与感知质量的一致性。
  • 理论分析表明,在特定条件下,WGAN是度量GAN的一个特例,从而解释了后者的性能优势。

实验结果

研究问题

  • RQ1尽管理论基础相似,为何度量GAN在语音增强中优于WGAN?
  • RQ2在判别器中引入度量评估是否能稳定训练并减少由SI-SNR损失引起的尺度模糊性?
  • RQ3目标度量值(q)的选择如何影响度量GAN框架的性能?
  • RQ4在何种条件下度量GAN与WGAN等价?当二者不等价时,性能差距的成因是什么?

主要发现

  • TSEGAN在验证集上的SI-SNR性能优于基于WGAN的模型,表明其客观度量性能更优。
  • M-TSEGAN在目标值q=20时优于q=200的M-TSEGAN,表明较小的目标值能带来更好的度量拟合与性能表现。
  • 度量评估判别器成功缓解了由SI-SNR损失引起的尺度模糊性问题,从而实现了更稳定的训练。
  • 理论分析确认,在特定条件下,WGAN是度量GAN的一个特例,为理解度量GAN的性能优越性提供了理论基础。
  • 该框架具有灵活性,可与多种TasNet变体集成,从而在时域语音增强中实现更广泛的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。