[论文解读] Speech Denoising by Accumulating Per-Frequency Modeling Fluctuations
本文提出了一种无监督语音去噪方法,通过在WaveUnet中利用频带级建模波动来识别并抑制噪声。通过仅使用一个含噪语音片段进行网络训练,并在时间-频率域中累积拟合得分,该方法应用经典滤波器恢复清晰语音,在非平稳噪声场景下性能优于无监督基线方法,且与有监督最先进方法性能相当。
We present a method for audio denoising that combines processing done in both the time domain and the time-frequency domain. Given a noisy audio clip, the method trains a deep neural network to fit this signal. Since the fitting is only partly successful and is able to better capture the underlying clean signal than the noise, the output of the network helps to disentangle the clean audio from the rest of the signal. This is done by accumulating a fitting score per time-frequency bin and applying the time-frequency domain filtering based on the obtained scores. The method is completely unsupervised and only trains on the specific audio clip that is being denoised. Our experiments demonstrate favorable performance in comparison to the literature methods. Our code and samples are available at github.com/mosheman5/DNP and as supplementary. Index Terms: Audio denoising; Unsupervised learning
研究动机与目标
- 解决尽管有监督方法取得进展,但无监督深度学习在语音去噪领域进展缓慢的问题。
- 克服传统无监督方法依赖启发式假设(如非浊音段或噪声平稳性)的局限性。
- 开发一种仅基于单个含噪语音片段运行的方法,无需干净参考信号或外部数据集。
- 利用神经网络拟合过程中的不稳定性,识别噪声成分,并通过频带级得分累积提升去噪性能。
提出的方法
- 使用随机潜在向量作为输入,训练WaveUnet以最小化重建损失 $\|f_\theta(z) - y\|$,拟合单个含噪语音片段。
- 监控训练过程中网络在各时间-频率域中的拟合进度,识别模型最难以拟合的区域,这些区域指示噪声成分。
- 基于训练期间各时间-频率域中建模波动的幅值,累积每个频带的拟合得分。
- 利用累积的拟合得分作为掩码,应用经典时频域滤波器(如维纳滤波或LSA)抑制噪声成分。
- 在评估阶段,通过与干净信号比较,从训练过程中的最佳网络输出中选择最终去噪信号。
- 对结果进行后处理,应用高通滤波器(截止频率60 Hz),以去除低频噪声。
实验结果
研究问题
- RQ1能否利用在单个含噪语音片段上训练的深度神经网络在频带级的建模波动,有效区分噪声与清晰语音?
- RQ2基于训练不稳定的无监督方法是否优于依赖噪声平稳性或非浊音段等假设的传统无监督去噪算法?
- RQ3该方法是否能在无干净训练数据的情况下,实现与有监督最先进模型相当的性能?
- RQ4在传统无监督方法失效的非平稳噪声环境中,该方法表现如何?
主要发现
- 该方法在所有指标(CSIG、CBAK、COVL、PESQ、SSNR)上均优于大多数无监督基线方法,仅在CSIG和SSNR指标上略逊于MMSE-LSA,位列第二。
- 在缺乏非浊音段的场景(如静音被裁剪后),该方法显著优于MMSE-LSA,展现出对启发式假设的鲁棒性。
- 尽管完全无监督且仅在单个含噪样本上训练,该方法性能仍可媲美有监督的SEGAN模型。
- 与DAP [18]相比,性能提升显著,尤其在中高信噪比条件下,因DAP的谐波卷积引入了类似高斯的伪影。
- 在训练过程中对多个网络输出取平均无法提升性能,与图像DIP中的情况不同,表明音频与图像信号行为存在根本差异。
- 该方法性能稳定且具备良好的泛化能力,不依赖于对剪辑边缘处静音或非浊音内容的信号结构假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。