[论文解读] A Two-stage Complex Network using Cycle-consistent Generative Adversarial Networks for Speech Enhancement
本文提出一种两阶段复杂网络,结合Cycle-GAN与深层复值去噪网络,用于单通道语音增强。首先,Cycle-GAN估计干净语音的幅度并保持循环一致性;随后,复值去噪网络优化相位并抑制残留噪声,在多个数据集上实现了语音质量与噪声抑制的最先进性能。
Cycle-consistent generative adversarial networks (CycleGAN) have shown their promising performance for speech enhancement (SE), while one intractable shortcoming of these CycleGAN-based SE systems is that the noise components propagate throughout the cycle and cannot be completely eliminated. Additionally, conventional CycleGAN-based SE systems only estimate the spectral magnitude, while the phase is unaltered. Motivated by the multi-stage learning concept, we propose a novel two-stage denoising system that combines a CycleGAN-based magnitude enhancing network and a subsequent complex spectral refining network in this paper. Specifically, in the first stage, a CycleGAN-based model is responsible for only estimating magnitude, which is subsequently coupled with the original noisy phase to obtain a coarsely enhanced complex spectrum. After that, the second stage is applied to further suppress the residual noise components and estimate the clean phase by a complex spectral mapping network, which is a pure complex-valued network composed of complex 2D convolution/deconvolution and complex temporal-frequency attention blocks. Experimental results on two public datasets demonstrate that the proposed approach consistently surpasses previous one-stage CycleGANs and other state-of-the-art SE systems in terms of various evaluation metrics, especially in background noise suppression.
研究动机与目标
- 为解决基于Cycle-GAN的语音增强模型因循环一致性约束而残留噪声的局限性。
- 通过联合估计干净相位与抑制残留噪声,克服低信噪比条件下的相位失真问题。
- 通过将幅度与相位估计解耦为两阶段学习框架,提升语音质量与可懂度。
- 引入一种新型复值神经网络,结合时频注意力机制,实现端到端的复谱映射。
- 在公开数据集上验证两阶段方法相较于单阶段Cycle-GAN及其他最先进方法的优越性。
提出的方法
- 设计一种两阶段框架:首先,基于Cycle-GAN的幅度映射网络(CycleGAN-MM)利用相对平均损失与循环一致性损失估计干净谱幅度。
- 将估计的幅度与原始含噪相位结合,形成粗粒度增强的复谱作为第二阶段的输入。
- 在第二阶段引入一种深层复值去噪网络(DCD-Net),通过估计干净谱的实部与虚部来优化复谱。
- DCD-Net采用复值二维卷积与反卷积层,并结合复值时频注意力(T-FA)模块,以建模时间与频率域中的长程依赖关系。
- 整个系统以级联方式训练,先预训练第一阶段,再微调第二阶段。
- 第二阶段使用复值比值掩码进行损失计算,以提升相位估计的准确性。

实验结果
研究问题
- RQ1两阶段学习框架是否可通过解耦幅度与相位估计来提升语音增强性能?
- RQ2在Cycle-GAN幅度估计器后引入复值去噪网络,是否能有效减少残留噪声与相位失真?
- RQ3两阶段中均引入时频注意力机制,是否能增强全局依赖建模能力,并在低信噪比条件下提升性能?
- RQ4所提出的两阶段复值网络相较于单阶段Cycle-GAN及其他SOTA方法,在客观与主观指标上的表现如何?
- RQ5所提出方法在不同噪声类型与信噪比水平下是否具备鲁棒性?
主要发现
- 所提出的两阶段模型CycleGAN-DCD在Babble和Factory1噪声类型下,分别较CycleGAN-MM实现平均0.32和0.30的PESQ提升。
- 在Babble和Factory1噪声下,段落信噪比(SSNR)分别提升0.99 dB与1.03 dB,表明具有更优的噪声抑制能力。
- 在WSJ0-SI84 + DNS数据集上,CycleGAN-DCD在Factory1与Babble噪声下,分别较CycleGAN-MM实现0.27与0.30的DNSMOS得分提升。
- 与最佳非生成对抗网络基线模型(Noncausal-GCRN)相比,CycleGAN-DCD在平均性能上提升PESQ 0.06分、STOI 0.33%,SSNR 0.21 dB。
- 模型在CBAK(残留噪声)与COVL(整体质量)方面表现显著提升,证实了失真减少与语音质量增强。
- 消融实验表明,第二阶段的复值去噪网络对相位恢复与残留噪声抑制至关重要,其性能显著优于单阶段模型。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。