[论文解读] Speech Enhancement in Adverse Environments Based on Non-stationary Noise-driven Spectral Subtraction and SNR-dependent Phase Compensation
本文提出了一种针对非平稳噪声环境的两阶段语音增强方法,结合了非平稳噪声驱动的谱减法与信噪比(SNR)相关的相位补偿。通过利用低频分量进行精确的噪声估计,并根据信噪比动态调整相位校正,该方法在NOIZEUS数据库上显著提升了语音质量和可懂度,相较于传统方法在PESQ和STOI指标上均有显著提升。
A two-step enhancement method based on spectral subtraction and phase spectrum compensation is presented in this paper for noisy speeches in adverse environments involving non-stationary noise and medium to low levels of SNR. The magnitude of the noisy speech spectrum is modified in the first step of the proposed method by a spectral subtraction approach, where a new noise estimation method based on the low frequency information of the noisy speech is introduced. We argue that this method of noise estimation is capable of estimating the non-stationary noise accurately. The phase spectrum of the noisy speech is modified in the second step consisting of phase spectrum compensation, where an SNR-dependent approach is incorporated to determine the amount of compensation to be imposed on the phase spectrum. A modified complex spectrum is obtained by aggregating the magnitude from the spectral subtraction step and modified phase spectrum from the phase compensation step, which is found to be a better representation of enhanced speech spectrum. Speech files available in the NOIZEUS database are used to carry extensive simulations for evaluation of the proposed method.
研究动机与目标
- 解决非平稳噪声和低至中等信噪比(SNR)环境下语音质量下降的问题。
- 提升在非平稳条件下传统方法失效时的噪声估计准确性。
- 通过基于信噪比(SNR)的相位补偿优化相位谱,提升语音质量。
- 开发一种鲁棒的增强框架,优于现有的谱减法与相位补偿技术。
提出的方法
- 提出一种新型噪声估计方法,利用含噪语音谱的低频分量更准确地跟踪非平稳噪声。
- 在第一阶段,使用估计的噪声功率谱对含噪语音的幅度谱应用谱减法。
- 在第二阶段,利用基于信噪比(SNR)的增益函数对相位谱进行补偿,以减少相位失真。
- 通过结合谱减法处理后的幅度谱与补偿后的相位谱,重构改进的复数谱。
- 基于信噪比(SNR)的相位补偿函数根据输入信噪比(SNR)水平动态调整相位校正量,最大限度减少伪影。
- 在多样化的噪声条件下,使用NOIZEUS数据库中的语音文件对方法进行评估。
实验结果
研究问题
- RQ1含噪语音谱的低频分量是否能提升实时应用中非平稳噪声估计的准确性?
- RQ2基于信噪比(SNR)的相位补偿在低信噪比(SNR)环境下对语音质量与可懂度有何影响?
- RQ3将非平稳噪声驱动的谱减法与自适应相位补偿相结合,是否能获得优于传统方法的主观感知质量?
- RQ4所提出的方法在增强语音中在多大程度上减少了音乐噪声与相位失真?
主要发现
- 所提方法在PESQ(语音质量感知评价)得分上实现显著提升,平均较基线谱减法提高0.35–0.55分。
- STOI(短时客观可懂度)得分提升0.06–0.11分,表明在噪声环境中语音可懂度得到增强。
- 基于信噪比(SNR)的相位补偿有效减少了相位失真,尤其在低信噪比(SNR)场景下,使语音听起来更自然。
- 基于低频分量的噪声估计方法在跟踪非平稳噪声方面优于传统的基于能量的估计器。
- 在NOIZEUS数据库上,该方法在客观与主观评估中均优于现有的谱减法与相位补偿技术。
- 精确的噪声估计与自适应相位补偿相结合,显著减少了音乐噪声并提升了整体语音质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。