Skip to main content
QUICK REVIEW

[论文解读] Monaural source enhancement maximizing source-to-distortion ratio via automatic differentiation

Hiroaki NAKAJIMA, Yu Takahashi|arXiv (Cornell University)|Jun 15, 2018
Speech and Audio Processing参考文献 15被引用 7
一句话总结

本文提出一种基于深度神经网络(DNN)的单通道语音增强方法,通过自动微分最大化信干噪比(SDR)进行训练。与传统方法(如最小化重建误差的L1/L2损失,或最小化感知相似度的STOI)不同,该方法直接通过最大化SDR来优化噪声抑制,而SDR与信噪比(SNR)密切相关。实验结果表明,该方法在不同信噪比(SNR)条件下,显著优于基于L1、L2和STOI的基线模型,SIR和SDR性能均更优。

ABSTRACT

Recently, deep neural network (DNN) has made a breakthrough in monaural source enhancement. Through a training step by using a large amount of data, DNN estimates a mapping between mixed signals and clean signals. At this time, we use an objective function that numerically expresses the quality of a mapping by DNN. In the conventional methods, L1 norm, L2 norm, and Itakura-Saito divergence are often used as objective functions. Recently, an objective function based on short-time objective intelligibility (STOI) has also been proposed. However, these functions only indicate similarity between the clean signal and the estimated signal by DNN. In other words, they do not show the quality of noise reduction or source enhancement. Motivated by the fact, this paper adopts signal-to-distortion ratio (SDR) as the objective function. Since SDR virtually shows signal-to-noise ratio (SNR), maximizing SDR solves the above problem. The experimental results revealed that the proposed method achieved better performance than the conventional methods.

研究动机与目标

  • 为解决传统DNN目标函数在单通道语音增强中优先考虑信号相似性而非噪声抑制的局限性。
  • 通过直接优化信干噪比(SDR)这一反映信噪比(SNR)与失真程度的指标,提升噪声抑制性能。
  • 证明基于SDR的训练结合自动微分可获得优于标准损失函数(如L1、L2或STOI)的分离质量。
  • 验证SDR作为DNN在单通道语音分离任务中的训练目标的有效性,尤其在低SNR条件下。

提出的方法

  • 该方法利用自动微分反向传播通过SDR计算过程,实现端到端训练DNN用于单通道语音增强。
  • SDR通过将估计信号分解为目标分量(与干净信号对齐)和失真分量(包含噪声与伪影),并计算其能量比得到。
  • SDR目标函数定义为 $\text{SDR} = 10 \log_{10} \left( \frac{\| \mathbf{s}_{\text{target}} \|^2}{\| \mathbf{e}_{\text{distortion}} \|^2} \right) $,其中 $\mathbf{e}_{\text{distortion}}$ 为在干净信号子空间上正交投影后的残差。
  • DNN使用随机梯度下降进行训练,并采用早停策略,通过最小化负SDR实现优化过程中的SDR最大化。
  • 采用循环神经网络(RNN)作为模型架构,输入与输出序列长度为100,基于重叠的100样本窗口进行训练。
  • 在不同SNR条件(10 dB、0 dB、-10 dB)下,将该方法与基于L1、L2和STOI的目标函数进行对比。

实验结果

研究问题

  • RQ1将SDR作为训练目标是否能显著提升单通道语音增强中的噪声抑制性能,相比基于L1、L2或STOI的损失函数?
  • RQ2基于SDR的训练是否能同时提升SDR与信干比(SIR),表明噪声与干扰均被有效降低?
  • RQ3在噪声污染严重的低SNR条件下,该方法的性能表现如何?
  • RQ4自动微分能否有效用于优化SDR,尽管其涉及非平凡的信号分解过程?

主要发现

  • 在输入SNR为10 dB时,所提方法达到24.8 dB的SDR,显著优于L1(18.1 dB)和L2(18.3 dB)基线。
  • 在输入SNR为0 dB时,所提方法达到17.7 dB SDR,高于L1(13.5 dB)和L2(14.5 dB),表现持续优越。
  • 在输入SNR为-10 dB时,所提方法达到10.9 dB SDR,优于L1(8.5 dB)和L2(9.2 dB),展现出在高噪声环境下的鲁棒性。
  • 该方法还获得了更高的SIR值(在10 dB SNR时为25.0 dB),证实干扰与失真均被有效减少。
  • 对估计信号的视觉检查表明,与基于L2的估计相比,该方法能更有效地减少尖锐的噪声伪影。
  • SDR目标函数不惩罚幅度缩放,因此估计信号的幅度可能低于干净信号,但此不影响SDR评分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。