[论文解读] Phase-aware Single-stage Speech Denoising and Dereverberation with U-Net
本文提出一种单阶段U-Net框架,用于联合语音去噪与混响抑制,采用新型相位感知β-sigmoid掩码(PHM),通过在复数域强制满足三角不等式来提升相位估计性能。该方法引入多尺度时域余弦相似度损失,并优化推理策略,在DNS和WHAMR数据集上实现88.9%的计算量降低,且在SI-SDR和PESQ指标上取得显著提升,达到当前最优性能。
In this work, we tackle a denoising and dereverberation problem with a single-stage framework. Although denoising and dereverberation may be considered two separate challenging tasks, and thus, two modules are typically required for each task, we show that a single deep network can be shared to solve the two problems. To this end, we propose a new masking method called phase-aware beta-sigmoid mask (PHM), which reuses the estimated magnitude values to estimate the clean phase by respecting the triangle inequality in the complex domain between three signal components such as mixture, source and the rest. Two PHMs are used to deal with direct and reverberant source, which allows controlling the proportion of reverberation in the enhanced speech at inference time. In addition, to improve the speech enhancement performance, we propose a new time-domain loss function and show a reasonable performance gain compared to MSE loss in the complex domain. Finally, to achieve a real-time inference, an optimization strategy for U-Net is proposed which significantly reduces the computational overhead up to 88.9% compared to the naïve version.
研究动机与目标
- 通过将去噪与混响抑制模块统一为单一深度学习框架,解决现有分离模块的局限性。
- 通过利用幅值估计强制复数域中的几何约束,提升复值谱图中的相位估计精度。
- 设计一种时域损失函数,以增强语音增强中的感知质量与泛化能力。
- 优化U-Net推理以实现实时部署,同时不损失性能。
- 通过学习直接路径与混响路径的双PHM,在推理阶段实现混响抑制程度的可控调节。
提出的方法
- 提出相位感知β-sigmoid掩码(PHM),通过重用幅值估计来估计干净信号相位,并在复数域中强制混合信号、源信号与残差分量之间的三角不等式。
- 使用两个PHM分别估计直达路径与混响路径分量,实现在推理阶段对混响水平的动态控制。
- 设计一种多尺度强调的余弦相似度损失函数,应用于时域,以提升语音质量与时间一致性。
- 提出一种针对2D U-Net的计算优化策略,与朴素实现相比,将推理延迟降低高达88.9%。
- 使用复值谱图进行模型训练,结合PHM与时域损失,实现幅值与相位的联合优化。
- 在测试阶段应用零延迟动态范围压缩器,并线性混合直达与混响分量,以提升感知质量。
实验结果
研究问题
- RQ1能否通过单一深度神经网络在不依赖独立模块的前提下,同时有效处理语音去噪与混响抑制?
- RQ2如何通过复平面中的几何约束,提升复值语音增强中的相位估计性能?
- RQ3多尺度时域损失函数是否在语音质量与可懂度方面优于传统的复域MSE损失?
- RQ4在U-Net-based语音增强模型中,计算效率可实现多大程度的提升以支持实时部署?
- RQ5能否通过学习的双掩码在推理阶段实现对增强输出中混响比例的可控调节?
主要发现
- 所提出的多尺度强调余弦相似度损失在DNS挑战数据集(带混响)上使SI-SDR提升2.2 dB,在WHAMR(r2d任务)上提升1.09 dB,优于复数MSE损失。
- 相位感知β-sigmoid掩码在r2d任务中实现64%的相位增益,表明与干净信号的相位对齐性能显著提升。
- 优化后的实时U-Net模型(model10)实现4.32 ms/帧的推理时间,相比基线模型计算开销降低88.9%。
- 主观MOS评分达到3.36(因果-NRT)与3.24(因果-RT),表明在实时约束下仍具备高感知质量。
- 消融实验证实,所提损失函数在多个基准测试中,于去噪与混响抑制任务上均持续优于基线损失。
- 该方法在DNS与WHAMR数据集上均达到最先进性能,SI-SDR分别为17.91(DNS带混响)与10.40(WHAMR r2d),PESQ分别为3.01与3.16。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。