[论文解读] S-DCCRN: Super Wide Band DCCRN with learnable complex feature for speech enhancement
该论文提出S-DCCRN,一种用于32 kHz信号的超宽带语音增强模型,结合子带与全带处理,采用可学习复数特征编码和可学习谱压缩技术。通过集成级联子带与全带DCCRN架构、端到端可学习复数特征编码/解码,以及通过可学习谱压缩实现的自适应能量调节,S-DCCRN在DNS-2021盲测数据集上取得了3.62的MOS得分,达到最先进性能,优于PercepNet及其他领先模型。
In speech enhancement, complex neural network has shown promising performance due to their effectiveness in processing complex-valued spectrum. Most of the recent speech enhancement approaches mainly focus on wide-band signal with a sampling rate of 16K Hz. However, research on super wide band (e.g., 32K Hz) or even full-band (48K) denoising is still lacked due to the difficulty of modeling more frequency bands and particularly high frequency components. In this paper, we extend our previous deep complex convolution recurrent neural network (DCCRN) substantially to a super wide band version -- S-DCCRN, to perform speech denoising on speech of 32K Hz sampling rate. We first employ a cascaded sub-band and full-band processing module, which consists of two small-footprint DCCRNs -- one operates on sub-band signal and one operates on full-band signal, aiming at benefiting from both local and global frequency information. Moreover, instead of simply adopting the STFT feature as input, we use a complex feature encoder trained in an end-to-end manner to refine the information of different frequency bands. We also use a complex feature decoder to revert the feature to time-frequency domain. Finally, a learnable spectrum compression method is adopted to adjust the energy of different frequency bands, which is beneficial for neural network learning. The proposed model, S-DCCRN, has surpassed PercepNet as well as several competitive models and achieves state-of-the-art performance in terms of speech quality and intelligibility. Ablation studies also demonstrate the effectiveness of different contributions.
研究动机与目标
- 为解决超宽带(32 kHz)语音增强中缺乏有效深度学习模型的问题,该问题面临建模高频分量和频谱维度增加的挑战。
- 通过结合局部(子带)与全局(全带)频域信息,提升高保真语音增强中的语音质量与可懂度。
- 通过引入可学习谱压缩机制,克服固定谱压缩方法的局限性,实现对不同频带能量分布的动态调节。
- 通过端到端可训练的复数特征编码器与解码器,优化输入与输出表征,提升特征保真度与噪声抑制能力。
提出的方法
- 模型采用级联子带与全带(SAF)处理模块,使用两个轻量级DCCRN子模块:一个分别处理低频与高频子带,另一个用于全带整合,以平滑子带间的过渡。
- 在STFT之后应用复数特征编码器(CFE)以优化输入特征,同时在iSTFT前使用复数特征解码器(CFD)重建时频表示,两者均端到端训练。
- 引入可学习谱压缩(LSC)以自适应调节不同频带的能量,压缩比在训练过程中学习,以保留高频细节。
- 在子带DCCRN中使用分组复数卷积,分别处理低频与高频分量,提升建模效率与性能。
- 在子带与全带分支中,编码器与解码器之间引入跳跃连接,以保持特征完整性并减少信息损失。
- 完整模型S-DCCRN集成了SAF模块、CFE/CFD与LSC,实现在32 kHz采样率下卓越的噪声抑制与语音质量表现。

实验结果
研究问题
- RQ1级联子带与全带处理架构是否能提升32 kHz超宽带语音信号的语音增强性能?
- RQ2与标准STFT输入相比,端到端可学习复数特征编码与解码是否能增强特征表征与语音质量?
- RQ3可学习谱压缩在多大程度上提升了高频分量的保留与整体去噪性能?
- RQ4在客观与主观语音质量指标方面,所提出的S-DCCRN模型相较于PercepNet与DCCRN等最先进模型表现如何?
主要发现
- S-DCCRN在DNS-2021盲测数据集上取得3.62的平均意见得分(MOS),显著优于RNNoise(2.32)、DCCRN(3.30)与PercepNet(2.73)。
- 仅SAF模块相比基线DCCRN提升PESQ 0.17分,且模型参数更小,证明了子带与全带融合的优势。
- 引入可学习谱压缩(LSC)后,PESQ额外提升0.07分,表明模型学习到比固定压缩更有效地保留高频能量。
- CFE/CFD模块单独使用时因高频能量过低而表现欠佳,但与LSC结合后,相比仅使用SAF模块,PESQ提升0.08分。
- 学习到的谱压缩比显示,高频带(13 kHz以上)压缩程度较低(约0.5),有效保留了关键感知细节。
- 在VoiceBank与DEMAND数据集上,S-DCCRN取得PESQ 2.84、CSIG 4.03与STOI 0.940的性能,展现出在多项目标上的最先进表现。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。