Skip to main content
QUICK REVIEW

[论文解读] A fully recurrent feature extraction for single channel speech enhancement

P. V. Muhammed Shifas, Claudio Santelli|arXiv (Cornell University)|Jun 9, 2020
Speech and Audio Processing参考文献 24被引用 5
一句话总结

该论文提出了一种完全循环的特征提取模块 gruCNN,集成到语音增强模型中,以提升在噪声环境下的鲁棒性。通过将门控循环单元(GRUs)嵌入卷积层中,该模型能够捕捉时间上的局部噪声统计特性,相较于原始CNN模型,实现了高达1.5 dB的分段信噪比(SSNR)增益和0.4 MOS的提升,同时参数量减少了25%。

ABSTRACT

Convolutional neural network (CNN) modules are widely being used to build high-end speech enhancement neural models. However, the feature extraction power of vanilla CNN modules has been limited by the dimensionality constraint of the convolution kernels that are integrated - thereby, they have limitations to adequately model the noise context information at the feature extraction stage. To this end, adding recurrency factor into the feature extracting CNN layers, we introduce a robust context-aware feature extraction strategy for single-channel speech enhancement. As shown, adding recurrency results in capturing the local statistics of noise attributes at the extracted features level and thus, the suggested model is effective in differentiating speech cues even at very noisy conditions. When evaluated against enhancement models using vanilla CNN modules, in unseen noise conditions, the suggested model with recurrency in the feature extraction layers has produced a segmental SNR (SSNR) gain of up to 1.5 dB, an improvement of 0.4 in subjective quality in the Mean Opinion Score scale, while the parameters to be optimized are reduced by 25%.

研究动机与目标

  • 解决原始CNN在特征提取过程中对长期噪声上下文建模能力有限的问题。
  • 提升在未见的非平稳噪声条件下的语音增强性能。
  • 在不牺牲性能的前提下降低模型复杂度,实现对低资源设备的部署。
  • 将时间循环机制直接集成到特征提取阶段,而非作为独立的后处理模块。
  • 验证分频带循环建模在鲁棒语音增强中的有效性。

提出的方法

  • 提出一种新型的gruCNN单元,将门控循环单元(GRUs)嵌入卷积层中,实现在特征提取层级的时间建模。
  • 采用改进的CNN架构,其中每个卷积核均附加循环连接,以捕捉时变的噪声统计特性。
  • 采用混合模型gruCNN_FC-SE,结合gruCNN用于特征提取和全连接层用于谱映射。
  • 采用基于语谱图的输入表示,将每个频率子带视为时间序列,以利用自回归语音特性。
  • 利用GRU在参数量更少的情况下学习长期依赖关系的能力,优于标准LSTM。
  • 在包含多种噪声类型(包括未见条件)的多说话人数据集上进行端到端训练。

实验结果

研究问题

  • RQ1将循环机制直接集成到卷积特征提取层中,是否能提升单通道语音增强对未见噪声类型的鲁棒性?
  • RQ2与标准的后特征提取RNN相比,分频带循环建模在性能和参数效率方面表现如何?
  • RQ3所提出的gruCNN特征提取器在低信噪比条件下,对语音可懂度和主观质量的提升程度如何?
  • RQ4与传统RNN-CNN混合模型相比,该模型是否能在参数量更少的情况下实现更优性能?
  • RQ5循环结构是否能更好地实现非平稳噪声与语音成分的解耦?

主要发现

  • 在未见噪声条件下,gruCNN_FC-SE模型相较于原始CNN模型,实现了高达1.5 dB的分段信噪比(SSNR)增益。
  • 主观平均意见分(MOS)提升了0.4分,达到3.16,表明主观质量显著提升。
  • 与CNN_LSTM-SE基线相比,模型参数量减少了25%,参数量为2722万,而基线为3610万。
  • 性能增益在所有噪声类型中均保持一致,包括高度非平稳的街道噪声和稳定的施工噪声。
  • 在所有信噪比水平下,gruCNN在所有客观指标(PESQ、STOI、COVL、SSNR)上均优于CNN_FC-SE和CNN_LSTM-SE。
  • 该模型在区分局部化、低频噪声(如街道噪声)与语音成分方面表现出更优能力,归因于其通过分频带循环实现的局部统计建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。