[论文解读] DPCRN: Dual-Path Convolution Recurrent Network for Single Channel Speech Enhancement
该论文提出DPCRN,一种用于时频域单通道语音增强的双路卷积循环网络,结合CRN与DPRNN的优势,分别建模帧内频谱模式与帧间时序依赖关系。模型仅含0.8M参数,在Interspeech 2021 DNS挑战赛盲测数据集上取得3.57的平均意见得分(MOS),在宽带场景赛道中排名第三。
The dual-path RNN (DPRNN) was proposed to more effectively model extremely long sequences for speech separation in the time domain. By splitting long sequences to smaller chunks and applying intra-chunk and inter-chunk RNNs, the DPRNN reached promising performance in speech separation with a limited model size. In this paper, we combine the DPRNN module with Convolution Recurrent Network (CRN) and design a model called Dual-Path Convolution Recurrent Network (DPCRN) for speech enhancement in the time-frequency domain. We replace the RNNs in the CRN with DPRNN modules, where the intra-chunk RNNs are used to model the spectrum pattern in a single frame and the inter-chunk RNNs are used to model the dependence between consecutive frames. With only 0.8M parameters, the submitted DPCRN model achieves an overall mean opinion score (MOS) of 3.57 in the wide band scenario track of the Interspeech 2021 Deep Noise Suppression (DNS) challenge. Evaluations on some other test sets also show the efficacy of our model.
研究动机与目标
- 为在模型参数量有限的条件下,解决时频表示中长程时序依赖建模的挑战。
- 通过参数高效的深度学习架构,提升低信噪比与混响环境下的语音质量与可懂度。
- 通过降低计算复杂度,在保持高性能的同时实现实时推理。
- 在时频域中整合卷积网络对局部频谱模式的学习能力与双路RNN对长期序列建模的优势。
提出的方法
- DPCRN模型将CRN中的标准RNN替换为双路RNN(DPRNN)模块,以分别建模块内(帧内)与模块间(帧间)的依赖关系。
- 1D卷积层提取的特征输入DPRNN模块,该模块将频谱图帧分块处理,以减少序列长度并提升训练效率。
- 模型使用转置卷积解码器,从处理后的特征中重建增强后的语音波形,输出复数比掩码(CRM)。
- 损失函数结合时频均方误差(TF-MSE)与感知目标,以提升语音质量与可懂度。
- 将输入特征的频带维度降低至50,以在频谱分辨率与实时处理需求之间取得平衡。
- 模型采用端到端训练方式,以含噪语音谱图作为输入,以干净语音为目标进行监督,以CRM估计作为主要输出。

实验结果
研究问题
- RQ1与标准RNN相比,双路RNN架构是否能提升时频域语音增强中的频谱建模性能?
- RQ2将CRN与DPRNN结合,是否能在参数量更少的情况下实现优于现有最先进模型的性能?
- RQ3在低信噪比与复杂噪声条件下,DPCRN模型相较于基线模型表现如何?
- RQ4该模型是否能以极低的参数量与低延迟实现与实时应用相匹配的优异性能?
主要发现
- 在DNS挑战赛开发集上,DPCRN-2取得3.472的DNSMOS得分,优于NSNet2(3.243)、DTLN(3.226)与DCCRN(3.373)。
- 在DNS盲测数据集上,DPCRN整体MOS得分为3.57,在宽带场景赛道中排名第三,语音MOS为3.76,背景噪声MOS为4.34。
- 在模拟的WSJ0-MUSAN测试集上,DPCRN-1在低信噪比水平(≤0 dB)下优于DCCRN,表现出在恶劣条件下的鲁棒性。
- 在WSJ0-NOISEX92测试集上,DPCRN-1在PESQ、STOI与SDR指标上均超越所有基线模型,证实DPRNN在建模干扰性噪声方面的优势。
- DPCRN-2的PESQ与STOI高于DPCRN-1,尽管SDR略低,表明联合损失函数有效提升了感知质量。
- 模型在四核Intel i5-6300HQ处理器上每帧推理时间为8.9 ms,计算复杂度为7.45 GFLOPS,支持实时部署。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。