[论文解读] Tdcgan: Temporal Dilated Convolutional Generative Adversarial Network for End-to-end Speech Enhancement
该论文提出TDCGAN,一种新颖的端到端语音增强模型,采用在生成对抗网络(GAN)框架内结合深度可分离卷积的时序空洞卷积网络。通过在不增加参数量的情况下扩展感受野,并引入SNR梯度惩罚作为损失正则化,TDCGAN在仅使用512万参数(较SEGAN减少19倍)的情况下实现了最先进性能,同时提升了语音质量和信噪比(SNR),优于以往基于GAN的语音增强方法。
In this paper, in order to further deal with the performance degradation caused by ignoring the phase information in conventional speech enhancement systems, we proposed a temporal dilated convolutional generative adversarial network (TDCGAN) in the end-to-end based speech enhancement architecture. For the first time, we introduced the temporal dilated convolutional network with depthwise separable convolutions into the GAN structure so that the receptive field can be greatly increased without increasing the number of parameters. We also first explored the effect of signal-to-noise ratio (SNR) penalty item as regularization of the loss function of generator on improving the SNR of enhanced speech. The experimental results demonstrated that our proposed method outperformed the state-of-the-art end-to-end GAN-based speech enhancement. Moreover, compared with previous GAN-based methods, the proposed TDCGAN could greatly decreased the number of parameters. As expected, the work also demonstrated that the SNR penalty item as regularization was more effective than $L1$ on improving the SNR of enhanced speech.
研究动机与目标
- 解决传统基于STFT的语音增强方法因忽略相位信息而导致的性能下降问题。
- 通过直接建模原始波形,提升端到端语音增强性能,保留相位信息与时间上下文。
- 在保持或提升增强质量的同时,降低模型复杂度与参数数量。
- 探究在生成器损失中引入SNR惩罚作为正则化项,以提升增强语音信噪比的有效性。
- 开发一种轻量化、高性能的GAN基架构,适用于语音系统中的实际部署。
提出的方法
- 将时序空洞卷积网络(TDCN)与深度可分离卷积网络(DSCN)集成到GAN的生成器中,以在不增加参数量的情况下扩展感受野。
- 设计一个包含编码器、时序空洞卷积掩码估计器(TDCME)和解码器的生成器,用于将含噪波形映射为干净波形。
- 采用与SEGAN相似的判别器架构,使用一维卷积和实例归一化,以区分真实语音与生成语音。
- 应用简化的零中心梯度惩罚与双时间尺度更新规则,采用不同学习率以稳定训练过程。
- 在生成器损失函数中引入信号与噪声比(SNR)梯度惩罚作为正则化项,以提升增强语音的SNR。
- 使用Wasserstein距离作为对抗损失度量,引导生成器学习更真实的干净语音分布。
实验结果
研究问题
- RQ1在不增加模型参数量的前提下,时序空洞卷积结合深度可分离卷积是否能有效提升端到端语音增强中的感受野?
- RQ2在生成器损失中引入SNR作为梯度惩罚,是否相比L1正则化能带来更好的SNR性能?
- RQ3在客观指标(如PESQ、STOI和segSNR)方面,所提出的TDCGAN模型与最先进基于GAN的语音增强模型相比表现如何?
- RQ4该架构在多大程度上减少了模型规模,同时保持或提升增强质量?
- RQ5空洞卷积与SNR正则化的结合是否能带来在噪声环境中更鲁棒、更符合听觉感知的语音增强效果?
主要发现
- TDCGAN在PESQ指标上达到2.87分,优于SEGAN(2.16)、Sergan*(2.51)和CP-GAN(2.64),表明语音质量显著提升。
- 在SNR正则化下,模型实现segSNR为9.97 dB,优于L1正则化变体(9.82 dB)及所有基线模型,证实SNR惩罚的有效性。
- TDCGAN将可训练参数量减少至512万,较SEGAN(9747万)减少19倍,较Sergan(8224万)减少16倍,较CP-GAN(估算>2600万)减少5倍。
- SNR惩罚正则化在提升segSNR方面优于L1正则化,证实其在增强信噪比方面的优越性。
- TDCGAN在STOI、Csing、Cbak和Covl指标上分别达到0.945、4.17、3.46和3.53,各项指标均超过或匹配最佳基线结果。
- 模型在多个指标上的性能增益保持一致,证实其在增强含噪语音波形方面具有鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。