Skip to main content
QUICK REVIEW

[论文解读] Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network for Speech Enhancement

Liming Zhou, Yongyu Gao|arXiv (Cornell University)|Apr 12, 2021
Speech and Audio Processing参考文献 38被引用 12
一句话总结

该论文提出CARN,一种新颖的语音增强模型,通过在U-Net-like编码器-解码器架构中引入基于注意力的跳跃连接,结合卷积和循环层实现复杂谱映射。通过用注意力机制替代CRN中的直接跳跃连接,CARN在DNS Challenge 2020上实现了最先进性能,相较于之前的SOTA模型,在真实录音上的关键指标(如PESQ、CSIG和DNSMOS)上提升超过10%。

ABSTRACT

Speech enhancement has benefited from the success of deep learning in terms of intelligibility and perceptual quality. Conventional time-frequency (TF) domain methods focus on predicting TF-masks or speech spectrum,via a naive convolution neural network or recurrent neural network.Some recent studies were based on Complex spectral Mapping convolution recurrent neural network (CRN) . These models skiped directly from encoder layers' output and decoder layers' input ,which maybe thoughtless. We proposed an attention mechanism based skip connection between encoder and decoder layers,namely Complex Spectral Mapping With Attention Based Convolution Recurrent Neural Network (CARN).Compared with CRN model,the proposed CARN model improved more than 10% relatively at several metrics such as PESQ,CBAK,COVL,CSIG and son,and outperformed the place 1st model in both real time and non-real time track of the DNS Challenge 2020 at these metrics.

研究动机与目标

  • 通过用基于注意力的机制替换CRN中的简单跳跃连接,提升语音增强性能。
  • 解决传统时频域方法忽略相位和时序依赖性的局限性。
  • 通过复杂谱映射和注意力机制,提升在非平稳噪声环境下的鲁棒性。
  • 在合成数据集和真实世界噪声语音数据集上均实现卓越性能。
  • 验证注意力机制在连接编码器与解码器特征方面在语音增强中的有效性。

提出的方法

  • CARN采用U-Net风格架构,包含6个编码器和解码器的Conv2d模块,使用PReLU激活函数和批量归一化。
  • 在编码器与解码器之间使用具有512个隐藏单元的LSTM层,以建模长程时序依赖性。
  • 引入基于注意力的跳跃连接,选择性地聚合来自编码器的特征到解码器,替代CRN中的直接跳跃连接。
  • 模型在时频域预测复数比掩码(CRM),并将该掩码与输入的STFT相乘以重建干净语音。
  • 还提出了门控卷积变体GCARN,以评估该架构中门控机制的必要性。
  • 模型采用监督学习进行训练,目标为CRM,并通过PESQ、CSIG、CBAK、COVL、STOI和DNSMOS进行评估。

实验结果

研究问题

  • RQ1基于注意力的跳跃连接是否能在CRN中超越直接跳跃连接,提升语音增强性能?
  • RQ2在基于U-Net的CRN架构中集成注意力机制,是否能在合成和真实世界噪声语音上均取得更好结果?
  • RQ3CARN在DNS Challenge 2020数据集上与SOTA模型如DCCRN-E和poCoNet相比表现如何?
  • RQ4注意力机制在跳跃连接中在多大程度上过滤了噪声特征?
  • RQ5在该架构中,结合门控卷积是否能带来额外增益?

主要发现

  • 在数据集1上,CARN相较于基线CRN在PESQ上提升12.2%,CBAK提升10.7%,COVL提升11.7%,CSIG提升10.8%。
  • GCARN相较于GCRN在PESQ上提升19.1%,在CSIG上提升15.1%,表明在使用注意力机制时,门控卷积可能并非必要。
  • 在DNS Challenge 2020非实时测试赛道中,CARN相较于之前的SOTA模型(poCoNet)在PESQ上提升6.2%,CBAK提升20.7%,COVL提升5.3%,CSIG提升3.7%。
  • 在DNS Challenge 2020盲测数据集上,CARN在所有条件下(非混响、混响和真实录音)均取得最高的DNSMOS得分3.72。
  • GCARN在DNSMOS性能上与CARN持平,平均得分为3.72,证实了注意力机制的鲁棒性。
  • 注意力机制有效过滤了跳跃连接中的噪声特征,从而在性能上显著超越CRN中的简单跳跃连接。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。