Skip to main content
QUICK REVIEW

[论文解读] Two Heads Are Better Than One: A Two-Stage Approach for Monaural Noise Reduction in the Complex Domain

Andong Li, Chengshi Zheng|arXiv (Cornell University)|Nov 3, 2020
Speech and Audio Processing参考文献 26被引用 10
一句话总结

该论文提出了一种两阶段复数域语音增强网络(CTS-Net),通过解耦幅度与相位估计,提升了单耳噪声抑制性能。首先,利用改进的门控时序卷积模块(MG-TCM)生成粗略的幅度估计,并与含噪相位结合形成粗略的复数谱。随后,第二阶段网络通过学习残差,对实部与虚部进行精细化优化,显著提升了PESQ、ESTOI和SDR指标,尤其在低信噪比(SNR)条件下表现突出。

ABSTRACT

In low signal-to-noise ratio conditions, it is difficult to effectively recover the magnitude and phase information simultaneously. To address this problem, this paper proposes a two-stage algorithm to decouple the joint optimization problem w.r.t. magnitude and phase into two sub-tasks. In the first stage, only magnitude is optimized, which incorporates noisy phase to obtain a coarse complex clean speech spectrum estimation. In the second stage, both the magnitude and phase components are refined. The experiments are conducted on the WSJ0-SI84 corpus, and the results show that the proposed approach significantly outperforms previous baselines in terms of PESQ, ESTOI, and SDR.

研究动机与目标

  • 解决低信噪比(SNR)条件下单耳语音增强中幅度与相位联合估计的挑战。
  • 将幅度与相位的复杂数学优化问题分解为两个顺序执行、易于处理的子任务。
  • 通过在第二阶段对频谱幅度与相位进行精细化处理,提升语音的感知质量与可懂度。
  • 通过改进的门控时序卷积模块(MG-TCM)减少参数冗余,并增强序列建模能力。
  • 在时频域中,证明所提方法在客观指标上持续优于现有基于深度学习的语音增强方法。

提出的方法

  • 采用两阶段架构:第一阶段仅估计干净幅度(CME-Net),第二阶段对完整复数谱进行精细化处理(CSR-Net)。
  • 在第一阶段,将估计的幅度与含噪相位结合,形成粗略的复数谱估计。
  • 在第二阶段,CSR-Net学习粗略估计与干净复数谱之间的残差,同时优化实部与虚部。
  • 引入一种改进的门控时序卷积模块(MG-TCM),相比标准TCM,可减少参数冗余并提升长距离时序建模能力。
  • 采用空洞因果卷积(SD-conv)扩大感受野,同时不增加参数量,从而增强上下文建模能力。
  • 采用实部/虚部上的L1损失与幅度损失相结合的方式进行端到端训练。

实验结果

研究问题

  • RQ1将幅度与相位估计解耦为两阶段是否能提升低信噪比(SNR)条件下单耳语音增强的性能?
  • RQ2先估计幅度再对复数谱进行精细化处理的两阶段方法,是否能比联合优化方法带来更好的感知质量与可懂度?
  • RQ3改进的门控时序卷积模块(MG-TCM)是否能在减少参数冗余的同时,优于标准TCM的序列建模能力?
  • RQ4在第二阶段对复数谱采用残差学习,是否能显著提升PESQ、ESTOI与SDR指标?
  • RQ5与当前最先进方法相比,所提两阶段方法在客观指标与模型效率方面表现如何?

主要发现

  • 所提出的CTS-Net在WSJ0-SI84测试集上取得了PESQ 2.71、ESTOI 72.27%与SDR 10.24 dB的性能,显著优于所有基线方法。
  • 第一阶段采用MG-TCM相比原始TCM,使PESQ提升0.04,ESTOI提升0.50%,证明其参数冗余更低且性能更优。
  • 在第二阶段将MG-TCM替换为双分支版本(DMG-TCM),PESQ提升0.01,ESTOI提升0.38%,证实其建模能力更强。
  • 与标准空洞卷积相比,使用空洞因果卷积(SD-conv)使PESQ提升0.03,ESTOI提升0.52%,SDR提升0.13 dB。
  • 相比仅使用CME-Net,CTS-Net使PESQ提升0.25,ESTOI提升6.94%,证明第二阶段精细化处理的必要性。
  • 与GCRN相比,CTS-Net在PESQ上高0.18,ESTOI高4.29%,SDR高1.38 dB,证明其在各项指标上均具持续优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。