[论文解读] ICASSP 2021 Deep Noise Suppression Challenge: Decoupling Magnitude and Phase Optimization with a Two-Stage Deep Network
该论文提出了一种两阶段深度神经网络TSCN-PP,用于实时语音增强,通过解耦幅度和相位优化:首先粗略估计幅度,然后在第二阶段同时优化幅度和相位,最后通过轻量级后处理模块抑制残留噪声。该方法在ICASSP 2021 DNS Challenge实时赛道中取得第一名性能,ITU-T P.808标准下MOS得分为3.38,尽管客观指标略有下降,但主观质量显著提升。
It remains a tough challenge to recover the speech signals contaminated by various noises under real acoustic environments. To this end, we propose a novel system for denoising in the complicated applications, which is mainly comprised of two pipelines, namely a two-stage network and a post-processing module. The first pipeline is proposed to decouple the optimization problem w:r:t: magnitude and phase, i.e., only the magnitude is estimated in the first stage and both of them are further refined in the second stage. The second pipeline aims to further suppress the remaining unnatural distorted noise, which is demonstrated to sufficiently improve the subjective quality. In the ICASSP 2021 Deep Noise Suppression (DNS) Challenge, our submitted system ranked top-1 for the real-time track 1 in terms of Mean Opinion Score (MOS) with ITU-T P.808 framework.
研究动机与目标
- 解决在复杂真实声学环境中(包含多种噪声类型和混响)的语音增强挑战。
- 在低信噪比和非理想条件下,提升主观语音质量,超越仅靠客观指标可捕捉的范围。
- 克服单阶段网络在测试条件与训练数据不匹配时处理非线性失真的局限性。
- 开发一种适用于助听器、自动语音识别(ASR)和通信系统部署的实时、低延迟系统。
- 验证后处理可在轻微降低客观分数的情况下,仍显著提升主观感知质量。
提出的方法
- 系统采用两阶段网络:首先,粗略幅度估计网络(CME-Net)从含噪输入中估计谱幅度。
- 其次,复谱精炼网络(CSR-Net)将含噪谱和粗略估计作为输入,对幅度和相位进行精炼。
- CSR-Net通过仅预测粗略估计与干净目标之间的差异实现残差学习,从而提升稳定性和准确性。
- 在两阶段网络之后应用轻量级后处理(PP)模块,以抑制不自然的残留噪声分量。
- PP模块通过针对非语音类失真(感知上令人不适但未被标准指标捕捉)进行优化,提升感知质量。
- 模型在复谱域中进行训练,使用实部和虚部,实现幅度和相位的联合优化。
实验结果
研究问题
- RQ1解耦幅度和相位优化是否能提升复杂真实环境中语音增强的性能?
- RQ2两阶段网络架构是否在处理挑战性噪声和混响方面优于单阶段模型?
- RQ3轻量级后处理模块是否能在轻微降低客观指标的情况下显著提升主观语音质量?
- RQ4相位精炼在幅度仅估计之外,对感知质量的贡献有多大?
- RQ5该系统在罕见或困难语音类型(如演唱、声调语言或情绪化语音)上的表现如何?
主要发现
- TSCN-PP系统在ICASSP 2021 DNS Challenge实时赛道中取得平均意见得分(MOS)3.38,主观质量排名第一。
- 与SOTA基线DCCRN相比,TSCN在所有测试集上的平均PESQ提升0.14,ESTOI提升1.77%。
- 后处理模块在AB测试中始终提升主观偏好,100%的听者更偏好TSCN-PP而非仅TSCN。
- 尽管后处理后客观指标(PESQ和ESTOI)略有下降,但MOS得分上升,表明客观与主观质量之间存在差距。
- 系统算法延迟为30ms(20ms帧长 + 10ms重叠),满足实时延迟要求,每帧平均处理时间为4.80ms。
- 该方法整体优于基线NSnet2 0.17 MOS分,尤其在挑战性场景中表现显著:如演唱语音(3.14 vs. 3.10)和非英语语音(3.50 vs. 3.28)中提升明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。