[论文解读] Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
本文提出了一种复杂的卷积块注意力模块(CCBAM)和一种联合时频损失,以增强使用深度复数U-Net和CRN模型的单耳语音。CCBAM通过在复数卷积中关注通道和空间特征来提升特征表示能力,而混合损失则联合优化时域和频域,使在两个数据集上的PESQ、STOI和SI-SNR指标均取得显著提升,达到当前最优性能。
Deep complex U-Net structure and convolutional recurrent network (CRN) structure achieve state-of-the-art performance for monaural speech enhancement. Both deep complex U-Net and CRN are encoder and decoder structures with skip connections, which heavily rely on the representation power of the complex-valued convolutional layers. In this paper, we propose a complex convolutional block attention module (CCBAM) to boost the representation power of the complex-valued convolutional layers by constructing more informative features. The CCBAM is a lightweight and general module which can be easily integrated into any complex-valued convolutional layers. We integrate CCBAM with the deep complex U-Net and CRN to enhance their performance for speech enhancement. We further propose a mixed loss function to jointly optimize the complex models in both time-frequency (TF) domain and time domain. By integrating CCBAM and the mixed loss, we form a new end-to-end (E2E) complex speech enhancement framework. Ablation experiments and objective evaluations show the superior performance of the proposed approaches (https://github.com/modelscope/ClearerVoice-Studio).
研究动机与目标
- 通过增强复数卷积层的表示能力,提升单耳语音增强性能。
- 解决现有注意力机制在复数深度学习模型中用于语音增强时的局限性。
- 开发一种轻量化、通用的注意力模块,可兼容任意复数卷积层。
- 通过混合损失函数,联合优化时域与频域的语音增强。
- 通过端到端复数网络,在单耳语音增强基准测试中实现当前最优性能。
提出的方法
- 提出一种复杂的卷积块注意力模块(CCBAM),在复数特征图的通道和空间维度上分别应用挤压-激励操作。
- CCBAM通过在复数特征的实部和虚部上分别进行全局平均池化和可学习全连接层,计算注意力权重。
- 将CCBAM集成到深度复数U-Net和CRN模型的解码器层及跳跃连接中,以优化特征表示。
- 设计一种混合损失函数,结合了尺度不变信噪比(SI-SNR)与理想复数比掩蔽(CRM)实部和虚部的均方误差(MSE)。
- 使用联合损失端到端优化模型,以提升时域与频域中CRM的估计性能。
- 对DCUnet使用64ms汉宁窗与16ms步长的STFT,对DCCRN使用20ms/10ms的STFT,采用PyTorch与Adam优化器。
实验结果
研究问题
- RQ1复数注意力机制能否提升单耳语音增强模型中卷积层的表示能力?
- RQ2将CCBAM集成到深度复数U-Net与CRN架构中是否能带来性能提升?
- RQ3一种结合SI-SNR与CRM-MSE的联合时频损失函数,能否在超越单域优化的基础上提升语音增强性能?
- RQ4所提出的框架在多样噪声与干净语音数据集上与当前最优模型相比表现如何?
- RQ5CCBAM模块是否在不同模型架构与数据分布下均能提供一致的性能提升?
主要发现
- DCUnet-MC与DCCRN-MC模型(同时集成CCBAM与混合损失)在数据集-1和数据集-2上分别取得最高的PESQ得分3.44与3.30。
- 在数据集-1上,DCUnet-MC模型相比原始DCUnet,PESQ提升0.19,SI-SNR提升1.62 dB;相比DCUnet-M,PESQ提升0.10,SI-SNR提升0.91 dB。
- 在数据集-2上,DCCRN-MC模型取得PESQ 3.30,相比DCCRN-M提升0.06,相比基线DCCRN提升0.10。
- 与仅使用SI-SNR训练相比,联合损失函数(混合损失)在数据集-1和数据集-2上分别使SI-SNR提升0.44 dB。
- CCBAM模块对性能提升贡献显著,DCUnet-MC在数据集-1上相比DCUnet-M,PESQ提升0.06,SI-SNR提升0.74 dB。
- 所提出的框架在小规模WSJ0+DEMAND与大规模DNS挑战数据集上均达到当前最优性能,展现出强大的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。