[论文解读] Dynamic Noise Embedding: Noise Aware Training and Adaptation for Speech Enhancement
本文提出动态噪声嵌入(DNE),一种针对语音增强的噪声感知训练方法,利用语音活动检测(VAD)识别非语音(仅噪声)帧,并通过一个简单的前馈神经网络提取自适应噪声嵌入。DNE与输入特征拼接,以提升在非平稳及未见噪声环境下的鲁棒性,在未见噪声上的PESQ(+8.58%)和STOI(+11.6%)取得显著提升,且在多种神经网络架构中均表现一致改进。
Estimating noise information exactly is crucial for noise aware training in speech applications including speech enhancement (SE) which is our focus in this paper. To estimate noise-only frames, we employ voice activity detection (VAD) to detect non-speech frames by applying optimal threshold on speech posterior. Here, the non-speech frames can be regarded as noise-only frames in noisy signal. These estimated frames are used to extract noise embedding, named dynamic noise embedding (DNE), which is useful for an SE module to capture the characteristic of background noise. The DNE is extracted by a simple neural network, and the SE module with the DNE can be jointly trained to be adaptive to the environment. Experiments are conducted on TIMIT dataset for single-channel denoising task and U-Net is used as a backbone SE module. Experimental results show that the DNE plays an important role in the SE module by increasing the quality and the intelligibility of corrupted signal even if the noise is non-stationary and unseen in training. In addition, we demonstrate that the DNE can be flexibly applied to other neural network-based SE modules.
研究动机与目标
- 为提升在非平稳及未见噪声环境下的语音增强鲁棒性,此类环境常因噪声特征不匹配导致传统方法表现不佳。
- 开发一种无需显式噪声标注即可动态捕捉背景噪声特征的噪声感知训练机制。
- 通过利用VAD预测的非语音帧作为噪声信息来源,实现VAD与语音增强模块的端到端联合优化。
- 设计一种灵活、可插拔的噪声嵌入(DNE),以增强各类基于深度学习的语音增强架构。
- 证明DNE在提升语音质量(PESQ)和可懂度(STOI)方面的有效性,尤其在具有挑战性的噪声条件下。
提出的方法
- 通过在语音后验概率上应用阈值,利用VAD检测非语音帧,识别出可能仅含噪声的帧。
- 利用VAD输出从含噪语音信号中提取仅噪声帧,作为噪声表征的基础。
- 通过一个简单的前馈神经网络(FCL)处理这些估计的仅噪声帧的幅度谱,生成动态噪声嵌入(DNE)。
- 将DNE与语音增强(SE)模块的输入声学特征(如对数功率谱图)拼接,使模型能够基于当前噪声特征进行条件化。
- SE与VAD模块端到端联合训练,使DNE能够以噪声感知方式被优化。
- 该方法应用于多种主干架构(U-Net、DDAE、BLSTM),验证了其泛化性与灵活性。
实验结果
研究问题
- RQ1VAD衍生的非语音帧能否可靠地作为仅噪声成分的代理,以估计背景噪声特征?
- RQ2在未见和非平稳噪声环境中,引入动态学习的噪声嵌入(DNE)是否能提升语音增强性能?
- RQ3VAD中语音后验概率的阈值选择如何影响DNE的质量与鲁棒性?
- RQ4DNE能否在多种基于深度学习的语音增强架构中有效迁移并提升性能?
- RQ5与独立训练或预训练模块组合相比,采用DNE联合训练VAD与SE模块是否更具有效性?
主要发现
- 所提出的DNE方法在未见噪声环境下相比基线U-Net,PESQ相对提升8.58%,STOI相对提升11.6%,表明其对噪声失配具有强鲁棒性。
- DNE在机枪噪声(一种突发性、非平稳噪声)上显著提升性能,表明其在处理瞬态和不可预测噪声方面的有效性。
- VAD基于噪声帧选择的最优阈值为0.3,该值在帧可靠性与足够数量之间取得平衡;低于0.3的阈值因帧数不足而降低性能。
- 仅当噪声帧可靠时,使用估计噪声帧的平均值(CN)才能提升性能;而对所有帧进行简单平均(SN)则会降低性能。
- DNE在多种架构(U-Net、DDAE、BLSTM)中均一致提升性能,证明其作为辅助特征的泛化能力与灵活性。
- 消融实验表明,DNE在未见噪声条件下显著优于基线及其它噪声估计方法,证实其在噪声感知训练中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。