[论文解读] Speech Enhancement In Multiple-Noise Conditions using Deep Neural Networks
本文提出了一种基于深度神经网络(DNN)的语音增强方法,用于处理真实办公环境中多种同时存在的稳态与非稳态噪声,采用动态噪声估计和心理声学加权训练。最佳模型在所有信噪比(SNR)下相对于含噪语音的平均PESQ提升达23.97%,显著优于Log-MMSE等经典方法,在复杂多噪声条件下表现更优。
In this paper we consider the problem of speech enhancement in real-world like conditions where multiple noises can simultaneously corrupt speech. Most of the current literature on speech enhancement focus primarily on presence of single noise in corrupted speech which is far from real-world environments. Specifically, we deal with improving speech quality in office environment where multiple stationary as well as non-stationary noises can be simultaneously present in speech. We propose several strategies based on Deep Neural Networks (DNN) for speech enhancement in these scenarios. We also investigate a DNN training strategy based on psychoacoustic models from speech coding for enhancement of noisy speech
研究动机与目标
- 解决真实办公环境中多种稳态与非稳态噪声同时存在时的语音增强问题。
- 通过建模复杂多源噪声失真,提升DNN语音增强方法在单一噪声或匹配噪声条件之外的鲁棒性。
- 探究使用动态噪声估计而非静态噪声提示的噪声感知训练的有效性。
- 评估心理声学加权DNN训练在优化过程中优先考虑感知重要频带的效果。
- 展示在未见、不匹配及高度非稳态噪声条件下的泛化能力与性能提升。
提出的方法
- 提出在100小时数据上训练的DNN架构,涵盖办公环境背景声、打印机和打字机等多种噪声类型,以建模复杂的多噪声环境。
- 每帧引入动态噪声估计作为输入特征,显著提升对非稳态噪声的处理性能,尤其在低信噪比(SNR)条件下。
- 采用受语音识别启发的噪声感知训练策略,利用动态噪声估计提升模型鲁棒性。
- 应用心理声学原理对DNN损失函数进行加权,优先优化对语音质量感知更重要的频带。
- 以梅尔频率倒谱系数(MFCC)作为输入,采用端到端DNN学习预测干净语音的谱包络幅度。
- 评估多种DNN变体:BD、BSD、BED和BEWD,其中BEWD结合了噪声感知与加权训练策略。
实验结果
研究问题
- RQ1基于DNN的语音增强能否有效处理真实办公环境中同时存在的多种噪声类型(包括稳态与非稳态)?
- RQ2在非稳态噪声条件下,使用每帧动态噪声估计是否优于静态噪声提示,能显著提升DNN性能?
- RQ3在低信噪比、多噪声场景下,心理声学加权DNN训练在提升语音质量与可懂度方面效果如何?
- RQ4在训练中未出现的或不匹配的噪声条件下,模型的泛化能力表现如何?
- RQ5在多样化噪声数据上训练的DNN能否在不同信噪比(SNR)水平下,尤其在低SNR条件下,实现稳健性能?
主要发现
- 最佳DNN模型(BEWD)在所有信噪比下相对于含噪语音的平均PESQ提升达23.97%,在-5 dB SNR时提升超过30%。
- 在-5 dB SNR条件下,BED DNN在STOI指标上较含噪语音提升15–16%,显著优于Log-MMSE。
- 将动态噪声估计作为输入特征可带来显著性能提升,尤其在低SNR下,因能更准确跟踪非稳态噪声。
- 心理声学加权训练在特定测试案例中表现出可测量的增益,但平均提升在极低SNR条件下最为显著。
- 更大规模的训练数据(100小时)相比小规模数据(25小时)带来更一致的性能提升,所有SNR水平下PESQ与STOI均更优。
- 频谱图与主观听感结果表明,BEWD生成的语音比Log-MMSE更清晰、更具可懂性,而Log-MMSE在高非稳态噪声下表现失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。