[论文解读] Interactive Speech and Noise Modeling for Speech Enhancement
本文提出 SN-Net,一种双分支卷积神经网络,通过分支间交互模块同时建模语音与噪声,以提升语音质量并抑制残留噪声。通过集成残差-卷积-注意力(RA)模块,并在语音与噪声分支之间实现特征交换,SN-Net 在语音增强与说话人分离任务上均达到最先进性能,在 Voice Bank + DEMAND 与 DNS Challenge 等公开基准上显著优于先前方法。
Speech enhancement is challenging because of the diversity of background noise types. Most of the existing methods are focused on modelling the speech rather than the noise. In this paper, we propose a novel idea to model speech and noise simultaneously in a two-branch convolutional neural network, namely SN-Net. In SN-Net, the two branches predict speech and noise, respectively. Instead of information fusion only at the final output layer, interaction modules are introduced at several intermediate feature domains between the two branches to benefit each other. Such an interaction can leverage features learned from one branch to counteract the undesired part and restore the missing component of the other and thus enhance their discrimination capabilities. We also design a feature extraction module, namely residual-convolution-and-attention (RA), to capture the correlations along temporal and frequency dimensions for both the speech and the noises. Evaluations on public datasets show that the interaction module plays a key role in simultaneous modeling and the SN-Net outperforms the state-of-the-art by a large margin on various evaluation metrics. The proposed SN-Net also shows superior performance for speaker separation.
研究动机与目标
- 为解决现有语音增强方法仅关注语音建模而忽略噪声特性的局限性。
- 通过语音与噪声分支之间的双向信息流,实现对语音与噪声的联合建模,以提升语音增强性能。
- 通过交互模块利用语音与噪声分支的互补特征,减少残留噪声与语音失真。
- 开发一种鲁棒的特征提取机制,以捕捉语音与噪声中的全局时序与频域依赖关系。
- 将所提框架扩展至说话人分离任务,验证其在单说话人增强之外的泛化能力。
提出的方法
- SN-Net 采用双分支编码器-解码器架构,语音与噪声分支共享结构,实现对两种信号的联合建模。
- 在多个中间层插入交互模块,实现语音与噪声分支之间的特征交换,增强特征判别力与表示精炼能力。
- 残差-卷积-注意力(RA)模块结合残差连接、深度可分离卷积以及并行的时间与频域自注意力机制,以建模长程依赖关系。
- 时间自注意力捕捉跨时间帧的全局模式,而频域自注意力则建模频带间的相关性。
- 网络通过重建损失与感知度量的组合进行训练,并在说话人分离任务中应用置换不变训练。
- 来自两个分支的特征图经 RA 模块处理,逐步优化表示,最终生成输出。
实验结果
研究问题
- RQ1与单向仅建模语音的方法相比,通过分支间交互实现语音与噪声的联合建模,是否能显著提升语音增强性能?
- RQ2在时间与频域维度上集成自注意力机制,对噪声语音中的特征表示有何影响?
- RQ3语音与噪声分支之间的交互在多大程度上可减少残留噪声与语音失真?
- RQ4所提出的双分支框架能否有效扩展至说话人分离任务?与现有 SOTA 方法相比表现如何?
- RQ5RA 模块与交互模块在提升整体增强质量与对多样化噪声类型的鲁棒性方面,其贡献程度如何?
主要发现
- 在 Voice Bank + DEMAND 数据集上,SN-Net 的 PESQ 得分为 3.12,显著优于所有对比的 SOTA 方法,包括基于 GAN 与自注意力的模型。
- 在 DNS Challenge 数据集上,SN-Net 的 SDRi 达到 8.39 dB,PESQ 为 2.50,分别优于 Conv-TasNet(SDRi: 7.57 dB,PESQ: 2.14)0.82 dB 与 0.36 分。
- 消融实验确认交互模块对性能有显著贡献,其在减少残留噪声与提升语音清晰度方面起关键作用。
- RA 模块有效捕捉了长程时序与频域依赖关系,注意力图显示其在语音中呈现全局关注,在噪声中则呈现局部模式。
- 在说话人分离任务中,SN-Net 相较于 Conv-TasNet 将 SDRi 提升 0.82 dB,PESQ 提升 0.36 分,展现出对多源分离的强大泛化能力。
- 在两个数据集的所有指标上,SN-Net 均取得最高分,表明其在多样化噪声条件下具备卓越的鲁棒性与增强质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。