Skip to main content
QUICK REVIEW

[论文解读] Convolutional Recurrent Neural Network Based Progressive Learning for Monaural Speech Enhancement

Andong Li, Minmin Yuan|arXiv (Cornell University)|Aug 28, 2019
Speech and Audio Processing参考文献 41被引用 10
一句话总结

该论文提出PL-CRNN,一种基于因果卷积循环神经网络的渐进式学习框架,用于单通道语音增强,在参数量较PL-DNN、PL-LSTM和CRNN减少92%-97%的情况下,实现了更优的语音质量和可懂度。该方法在保持高性能的同时降低了计算复杂度,尤其在低信噪比(SNR)条件下表现突出。

ABSTRACT

Recently, progressive learning has shown its capacity to improve speech quality and speech intelligibility when it is combined with deep neural network (DNN) and long short-term memory (LSTM) based monaural speech enhancement algorithms, especially in low signal-to-noise ratio (SNR) conditions. Nevertheless, due to a large number of parameters and high computational complexity, it is hard to implement in current resource-limited micro-controllers and thus, it is essential to significantly reduce both the number of parameters and the computational load for practical applications. For this purpose, we propose a novel progressive learning framework with causal convolutional recurrent neural networks called PL-CRNN, which takes advantage of both convolutional neural networks and recurrent neural networks to drastically reduce the number of parameters and simultaneously improve speech quality and speech intelligibility. Numerous experiments verify the effectiveness of the proposed PL-CRNN model and indicate that it yields consistent better performance than the PL-DNN and PL-LSTM algorithms and also it gets results close even better than the CRNN in terms of objective measurements. Compared with PL-DNN, PL-LSTM, and CRNN, the proposed PL-CRNN algorithm can reduce the number of parameters up to 93%, 97%, and 92%, respectively.

研究动机与目标

  • 为解决现有基于深度学习的单通道语音增强模型计算成本高、参数量大的问题,特别是在资源受限环境下的应用挑战。
  • 在传统方法失效的低信噪比(SNR)条件下,提升语音质量和可懂度。
  • 通过融合渐进式学习与参数高效的因果CRNN架构,在不牺牲性能的前提下降低模型复杂度。
  • 探究不同训练目标对语音增强性能的影响。

提出的方法

  • 所提出的PL-CRNN框架在每个渐进式学习阶段均采用因果卷积循环神经网络(CRNN)作为基础子模型,实现无需未来上下文信息的实时推理。
  • 在所有渐进式阶段之间应用参数共享机制,显著减少可训练参数总数,同时保持性能增益。
  • 渐进式学习将训练过程划分为多个阶段,每个阶段逐步提升信噪比(SNR),并将中间输出作为后续阶段的先验信息。
  • 模型采用两种不同的训练目标——干净语音和谱掩码,以评估其对增强质量的影响。
  • 该架构结合了卷积神经网络(CNN)在局部谱特征提取方面的优势,以及循环神经网络(RNN)在建模语音长期时序依赖关系方面的优势。
  • 使用浮点乘加(FMA)操作来量化计算复杂度,结果显示与基线模型相比FMAs数量显著减少。

实验结果

研究问题

  • RQ1与PL-DNN和PL-LSTM相比,基于因果CRNN的渐进式学习框架是否能在显著降低模型复杂度的同时实现更优的语音增强性能?
  • RQ2在渐进式训练阶段之间实施参数共享,如何影响参数数量和语音增强性能?
  • RQ3不同训练目标(如干净语音与谱掩码)对最终增强质量的影响是什么?
  • RQ4渐进式学习策略是否能提升在低SNR和非平稳噪声条件下的性能?
  • RQ5基于CRNN的模型是否能以远少的参数量和更低的FMA计数,实现与标准CRNN相当或更优的性能?

主要发现

  • 与PL-DNN相比,PL-CRNN将参数量减少了高达93%;与PL-LSTM相比减少了97%;与CRNN相比减少了92%,展现出最高的参数效率。
  • 在未见噪声条件下的测试中,PL-CRNN的PESQ达到2.60,STOI达到0.90,优于PL-DNN(PESQ: 2.36,STOI: 0.87)、PL-LSTM(PESQ: 2.44,STOI: 0.88)和CRNN(PESQ: 2.55,STOI: 0.89)。
  • 尽管仅包含122万个参数,PL-CRNN的性能仍优于SCRNN(440万个参数),且仅使用CRNN参数量的25%,充分验证了其高效性。
  • 当Q=5个阶段时,PL-CRNN的FMA数量(994万)略高于SCRNN(634万),但当Q=3时,PL-CRNN的FMA数量(594万)更低,且性能优于SCRNN。
  • 渐进式学习带来了持续的性能增益,尤其在低SNR条件下,得益于更优的学习动态和各阶段之间的先验知识迁移。
  • 确认了LSTM网络中存在饱和效应:增加堆叠LSTM层的参数量并未带来成比例的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。