Skip to main content
QUICK REVIEW

[论文解读] A Simultaneous Denoising and Dereverberation Framework with Target Decoupling

Andong Li, Wenzhe Liu|arXiv (Cornell University)|Jun 24, 2021
Speech and Audio Processing参考文献 38被引用 7
一句话总结

本文提出SDD-Net,一种基于链式优化策略的四阶段深度学习框架,用于同时进行语音去噪与混响抑制。该方法在早期阶段将复杂的谱学习解耦为仅幅度的去噪与混响抑制,随后通过残差学习联合优化幅度与相位,并应用轻量级后处理模块抑制残留噪声,最终在Interspeech 2021 DNS Challenge实时赛道中取得最高MOS性能。

ABSTRACT

Background noise and room reverberation are regarded as two major factors to degrade the subjective speech quality. In this paper, we propose an integrated framework to address simultaneous denoising and dereverberation under complicated scenario environments. It adopts a chain optimization strategy and designs four sub-stages accordingly. In the first two stages, we decouple the multi-task learning w.r.t. complex spectrum into magnitude and phase, and only implement noise and reverberation removal in the magnitude domain. Based on the estimated priors above, we further polish the spectrum in the third stage, where both magnitude and phase information are explicitly repaired with the residual learning. Due to the data mismatch and nonlinear effect of DNNs, the residual noise often exists in the DNN-processed spectrum. To resolve the problem, we adopt a light-weight algorithm as the post-processing module to capture and suppress the residual noise in the non-active regions. In the Interspeech 2021 Deep Noise Suppression (DNS) Challenge, our submitted system ranked top-1 for the real-time track in terms of Mean Opinion Score (MOS) with ITU-T P.835 framework

研究动机与目标

  • 为解决真实声学环境中背景噪声与房间混响共同导致的语音质量退化问题。
  • 通过在多阶段链式优化框架中联合优化去噪与混响抑制,提升主观语音质量。
  • 通过针对非活动语音区域的轻量级后处理模块,减少深度神经网络处理带来的残留伪影。
  • 验证显式混响抑制在提升人类感知语音质量方面的重要性,超越仅噪声抑制的效果。
  • 实现低延迟与低计算成本的实时性能,适用于实际部署。

提出的方法

  • 该框架采用链式优化策略,将复杂的谱学习分解为四个子阶段,依次解决去噪、混响抑制与谱重构问题。
  • 在前两个阶段中,仅处理幅度分量以抑制噪声与晚期混响,从而解耦多任务学习问题。
  • 第三阶段利用全局残差连接,基于前期估计结果联合优化幅度与相位。
  • 应用轻量级后处理模块,抑制非活动语音区域的残留噪声,以应对深度神经网络非线性带来的伪影。
  • 该方法利用概率链式法则将目标估计分解为 p(X|Y) = p(N|Y)p(R|Y,N)p(X|Y,R,N),实现分阶段优化。
  • 框架在时频域表示下端到端训练,采用STFT进行谱分析,并保持30ms的处理延迟。

实验结果

研究问题

  • RQ1多阶段链式优化框架是否能在同时去噪与混响抑制任务中超越单阶段DNN模型?
  • RQ2解耦幅度与相位估计是否能提升复谱域中两者的恢复效果?
  • RQ3尽管客观指标可能下降,残余噪声的后处理在多大程度上能提升主观语音质量?
  • RQ4显式混响抑制相较于仅噪声抑制,在提升平均意见得分(MOS)方面有何贡献?
  • RQ5该框架是否能实现低延迟与低计算成本的实时性能,适合实际部署?

主要发现

  • 所提出的SDD-Net框架在Interspeech 2021 DNS Challenge实时赛道中取得最高平均意见得分(MOS),在盲测集上MOS得分为72.94,排名首位。
  • 将混响抑制整合到框架中显著提升了MOS,证明显式晚期混响抑制对实现高主观语音质量的必要性。
  • 尽管客观指标(如PESQ与ESTOI)略有下降,后处理模块显著提升了MOS,凸显客观指标与人类感知之间的差距。
  • 该框架实现了30ms的处理延迟,每秒仅需6.00 GMACS计算量,适用于实时应用。
  • 基于ITU-T P.835的主观评估表明,SDD-Net在所有语音质量类别中均优于基线模型,甚至在某些情况下优于含噪参考信号,表明其具有优异的语音保真能力。
  • 系统拥有638万个可训练参数,架构高效,支持低延迟推理,标准CPU上单帧处理时间约为4.40ms。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。