Skip to main content
QUICK REVIEW

[论文解读] CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement

Sherif Abdulatif, Ruizhe Cao|arXiv (Cornell University)|Sep 22, 2022
Speech and Audio Processing参考文献 127被引用 11
一句话总结

该论文提出CMGAN,一种基于Conformer的度量生成对抗网络,用于单通道语音增强,在时频域中通过共享编码器和双分支解码器联合优化幅度和相位。该方法在去噪、反混响和超分辨率任务中均达到最先进性能,在Voice Bank+DEMAND数据集上PESQ为3.41,SSNR为11.10 dB,同时通过DNS-MOS和听音测试证明其对未见噪声类型的泛化能力出色。

ABSTRACT

In this work, we further develop the conformer-based metric generative adversarial network (CMGAN) model for speech enhancement (SE) in the time-frequency (TF) domain. This paper builds on our previous work but takes a more in-depth look by conducting extensive ablation studies on model inputs and architectural design choices. We rigorously tested the generalization ability of the model to unseen noise types and distortions. We have fortified our claims through DNS-MOS measurements and listening tests. Rather than focusing exclusively on the speech denoising task, we extend this work to address the dereverberation and super-resolution tasks. This necessitated exploring various architectural changes, specifically metric discriminator scores and masking techniques. It is essential to highlight that this is among the earliest works that attempted complex TF-domain super-resolution. Our findings show that CMGAN outperforms existing state-of-the-art methods in the three major speech enhancement tasks: denoising, dereverberation, and super-resolution. For example, in the denoising task using the Voice Bank+DEMAND dataset, CMGAN notably exceeded the performance of prior models, attaining a PESQ score of 3.41 and an SSNR of 11.10 dB. Audio samples and CMGAN implementations are available online.

研究动机与目标

  • 开发一种统一的深度学习框架,用于单通道语音增强,以解决去噪、反混响和超分辨率问题。
  • 通过使用可微分的度量判别器直接优化感知评价分数,克服语音增强中的度量不匹配问题。
  • 通过架构创新和广泛的消融研究,提升对未见噪声类型和失真的泛化能力。
  • 探索在复数时频域进行超分辨率的可行性与有效性,该任务此前极少被研究。

提出的方法

  • 提出一种基于Conformer的生成器,采用共享编码器处理拼接的幅度和复数(实部/虚部)谱图分量。
  • 在两阶段模块中使用双路径Transformer,高效建模来自共享表示的时序与频域依赖性。
  • 引入专用掩码解码器用于幅度估计,另设分支用于优化复数谱图的实部与虚部分量。
  • 使用训练有素的度量判别器预测不可微分的感知分数(如PESQ、STOI),以指导生成器,避免依赖ℓp-范数损失。
  • 应用空洞密集块,采用逐渐增大的空洞率,以捕捉长距离上下文,同时保持参数量适中。
  • 在解码器分支中使用子像素卷积和2D转置卷积进行特征上采样。

实验结果

研究问题

  • RQ1基于共享编码器的Conformer架构是否能在多任务单通道语音增强中超越现有模型?
  • RQ2与标准GAN相比,所提出的度量判别器在提升对未见噪声类型的泛化能力方面表现如何?
  • RQ3在复数时频域中联合优化幅度和相位,与仅优化幅度或时域方法相比,能否显著减少伪影?
  • RQ4CMGAN框架是否能有效处理具有挑战性的时间-频率超分辨率任务,与现有方法相比表现如何?

主要发现

  • 在Voice Bank+DEMAND数据集上,CMGAN在语音去噪任务中达到PESQ 3.41和SSNR 11.10 dB,优于先前最先进方法。
  • 通过DNS-MOS分数和听音测试验证,该模型在未见噪声类型和失真条件下展现出更优的泛化能力,且感知质量保持一致。
  • 在对比方法中,CMGAN在相位重建方面表现最佳,尤其在非平稳噪声条件下,如基带相位差的可视化结果所示。
  • 消融研究证实,共享编码器、双分支解码器和度量判别器均对性能有显著贡献,其中度量判别器对感知质量提升尤为关键。
  • CMGAN在时间-频率超分辨率任务中创下新的SOTA,是首批有效解决该复杂任务的方法之一。
  • 模型仅使用183万个参数即达到具有竞争力的性能,表明其具有极高的参数效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。