Skip to main content
QUICK REVIEW

[论文解读] Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data

Ziyi Xu, Maximilian Strake|arXiv (Cornell University)|Mar 31, 2021
Speech and Audio Processing参考文献 34被引用 4
一句话总结

本文提出了一种弱监督深度噪声抑制框架,利用非侵入式 PESQNet 实现无需干净参考信号即可使用真实噪声语音数据进行训练。通过交替使用合成数据和真实数据对复杂掩码型 FCRN 和 PESQNet 进行训练,该方法在 DNS3 基线基础上实现了 0.09 MOS 的提升,并在背景噪声质量方面实现了 0.45 MOS 的增益,标志着首次在非 GAN、无参考语音增强训练中成功应用真实数据。

ABSTRACT

Data-driven speech enhancement employing deep neural networks (DNNs) can provide state-of-the-art performance even in the presence of non-stationary noise. During the training process, most of the speech enhancement neural networks are trained in a fully supervised way with losses requiring noisy speech to be synthesized by clean speech and additive noise. However, in a real implementation, only the noisy speech mixture is available, which leads to the question, how such data could be advantageously employed in training. In this work, we propose an end-to-end non-intrusive PESQNet DNN which estimates perceptual evaluation of speech quality (PESQ) scores, allowing a reference-free loss for real data. As a further novelty, we combine the PESQNet loss with denoising and dereverberation loss terms, and train a complex mask-based fully convolutional recurrent neural network (FCRN) in a "weakly" supervised way, each training cycle employing some synthetic data, some real data, and again synthetic data to keep the PESQNet up-to-date. In a subjective listening test, our proposed framework outperforms the Interspeech 2021 Deep Noise Suppression (DNS) Challenge baseline overall by 0.09 MOS points and in particular by 0.45 background noise MOS points.

研究动机与目标

  • 解决使用缺乏干净参考信号的真实噪声语音数据训练深度语音增强模型的挑战。
  • 开发一种无参考的感知损失函数,通过直接从增强信号估计 PESQ 分数,实现真实数据的训练。
  • 克服先前学习质量度量(如 Quality-Net)在增强模型利用它们进行训练时性能下降的局限性。
  • 通过在弱监督训练协议中结合合成数据与真实数据,提升模型在真实世界测试数据上的泛化能力与性能。
  • 证明真实数据可在非 GAN、基于感知的语音增强训练中被有效利用。

提出的方法

  • 提出一种端到端的非侵入式 PESQNet,无需访问干净参考信号即可从增强语音信号中估计 PESQ 分数,从而实现无参考训练。
  • 引入一种弱监督训练协议(1-1-50),交替更新 FCRN 和 PESQNet,每个循环依次使用合成数据、真实数据和再次使用合成数据,以保持 PESQNet 的时效性。
  • 将 PESQNet 损失与先前工作中的降噪与混响抑制损失(Jsynth_u)结合,形成总损失 Jtotal_u,以平衡感知质量和信号保真度。
  • 使用基于复数掩码的全卷积循环网络(FCRN)进行语音增强,结合合成数据(用于 Jsynth_u)和真实数据(用于 PESQNet 损失)进行训练。
  • 采用一种新颖的训练调度策略,定期使用最新 FCRN 输出重新训练 PESQNet,以防止分布偏移并保持其准确性。
  • 利用 DNSMOS 和主观 MOS(ITU-T P.835)评估真实世界测试集上的性能,包括 DNS3 盲测测试集。

实验结果

研究问题

  • RQ1能否在无干净参考信号的情况下,有效利用真实噪声语音数据训练深度语音增强模型?
  • RQ2非侵入式 PESQNet 是否能提供稳定、可微且具有感知意义的损失,以支持真实数据的训练?
  • RQ3在增强网络与 PESQNet 之间交替训练,是否能防止因分布偏移或模型利用而导致的性能退化?
  • RQ4通过 PESQNet 损失整合真实数据,是否能提升在真实世界测试集上的性能,相比完全基于合成数据的训练?
  • RQ5是否可能在不使用生成对抗网络(GANs)的情况下,实现在真实数据上的最先进性能?

主要发现

  • 所提出的框架在盲测测试集上相比 DNS3 挑战基线提升了 0.09 MOS,表明主观质量有显著改善。
  • 该框架在背景噪声质量方面实现了 0.45 MOS 的提升,表明更有效地保留了自然感和噪声特征。
  • 在 DNS3 开发集的真实数据上,模型的 DNSMOS 得分为 3.33,优于除拥有完整真实数据访问权限的最优设置外的所有其他方法。
  • 尽管真实数据有限(仅 4 小时),1-1-50 训练协议(α=0.9)仍通过相比纯合成数据基线提升 0.02 DNSMOS,证明了真实数据的有效利用。
  • FCRN 与 PESQNet 的交替训练成功缓解了先前使用固定质量网络时报告的性能退化问题,长期保持了 PESQNet 的可靠性。
  • 本工作首次展示了在无 GAN 的前提下,利用感知性、无参考损失有效训练语音增强模型,且基于真实噪声数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。