Skip to main content
QUICK REVIEW

[论文解读] Deep Residual-Dense Lattice Network for Speech Enhancement

Mohammad Nikzad, Aaron Nicolson|arXiv (Cornell University)|Feb 27, 2020
Speech and Audio Processing参考文献 27被引用 7
一句话总结

本文提出了一种新型卷积神经网络架构——残差-密集晶格网络(RDL-Net),用于语音增强。该网络在三角晶格拓扑结构中结合残差连接与密集连接,实现高效特征重用,同时避免过度参数化。该方法在参数量和浮点运算量(FLOPs)远低于ResNets、DenseNets和DenseRNets的情况下,实现了最先进的语音增强性能,在客观质量与可懂度指标上均优于现有方法。

ABSTRACT

Convolutional neural networks (CNNs) with residual links (ResNets) and causal dilated convolutional units have been the network of choice for deep learning approaches to speech enhancement. While residual links improve gradient flow during training, feature diminution of shallow layer outputs can occur due to repetitive summations with deeper layer outputs. One strategy to improve feature re-usage is to fuse both ResNets and densely connected CNNs (DenseNets). DenseNets, however, over-allocate parameters for feature re-usage. Motivated by this, we propose the residual-dense lattice network (RDL-Net), which is a new CNN for speech enhancement that employs both residual and dense aggregations without over-allocating parameters for feature re-usage. This is managed through the topology of the RDL blocks, which limit the number of outputs used for dense aggregations. Our extensive experimental investigation shows that RDL-Nets are able to achieve a higher speech enhancement performance than CNNs that employ residual and/or dense aggregations. RDL-Nets also use substantially fewer parameters and have a lower computational requirement. Furthermore, we demonstrate that RDL-Nets outperform many state-of-the-art deep learning approaches to speech enhancement.

研究动机与目标

  • 为解决现有残差网络与密集网络在特征重用方面的低效问题,其中ResNets存在特征退化问题,而DenseNets则过度分配参数。
  • 开发一种新型卷积神经网络架构,结合残差与密集聚合机制,同时避免过度的参数或计算开销。
  • 通过一种新颖的晶格拓扑结构,实现块内有效梯度传播与块间特征重用,从而提升语音增强性能。
  • 证明所提出的RDL-Net在客观质量与可懂度指标上优于当前最先进的深度学习方法。
  • 在多个数据集与噪声条件下(包括街市音乐与工厂噪声)验证该架构的效率与有效性。

提出的方法

  • RDL-Net采用卷积单元的三角晶格拓扑结构,其中局部密集聚合被限制在晶格高度范围内,从而减少输入尺寸与参数负担。
  • 在块内使用局部残差连接,以改善梯度流动与训练稳定性。
  • 通过全局密集连接连接各块,实现块间特征重用,增强表征学习能力。
  • 采用混合聚合策略:使用残差求和以促进梯度流动,使用局部连接以实现特征重用,避免全连接DenseNets中出现的参数爆炸问题。
  • 网络采用Deep Xi框架进行训练,并利用先验信噪比(SNR)估计,用于MMSE-LSA与SRWF语音增强模型。
  • 通过标准指标(包括PESQ、STOI、MOS-LQO、CSIG、CBAK与COVL)在不同信噪比(SNR)水平的含噪语音数据上对方法进行评估。

实验结果

研究问题

  • RQ1能否设计一种卷积神经网络架构,结合残差与密集连接的优势,同时避免DenseNets的参数低效问题?
  • RQ2所提出的基于晶格的拓扑结构是否能减少高性能语音增强所需的参数量与FLOPs?
  • RQ3RDL-Net在客观语音质量与可懂度方面,相较于ResNets、DenseNets与当前最先进模型,优势程度如何?
  • RQ4RDL-Net在多种噪声类型与SNR条件下(如街市音乐与工厂噪声)的表现如何?
  • RQ5与基于GAN的方法及其他深度学习方法相比,RDL-Net能否在实现优异噪声抑制的同时,保持最小的频谱失真?

主要发现

  • 在10 dB SNR下,针对街市音乐噪声,RDL-Net在200万参数时相比ResNet的MOS-LQO提升0.22分。
  • 在200万参数与200万FLOPs条件下,RDL-Net达到与参数量翻倍、FLOPs增加四倍的ResNet相当的最低验证误差。
  • 在0 dB SNR下,针对工厂噪声,RDL-Net在200万参数时相比等效ResNet的STOI提升3.5%。
  • RDL-Net在CSIG上优于Metric-GAN 0.39分,CBAK上优于0.25分,COVL上优于0.30分,PESQ上优于0.16分,且STOI较MMSE-GAN提升1%。
  • 通过语谱图对比可直观确认,RDL-Net输出的语音在保持最小形式共振峰失真下,表现出更优的噪声抑制能力。
  • RDL-Net在多个数据集与噪声条件下均展现出一致的性能提升,证实其鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。