[论文解读] Noisy-target Training: A Training Strategy for DNN-based Speech Enhancement without Clean Speech
本文提出了一种基于深度神经网络的语音增强方法——噪声目标训练(Noisy-target Training, NyTT),该方法在训练过程中仅使用含噪信号,无需干净语音作为目标。通过使用同一语音信号的逐渐变脏的版本作为输入和目标,NyTT在训练与测试数据不匹配时实现了与使用干净目标训练相当的性能,SNR阈值可指示含噪信号何时可作为有效的‘干净’目标。
Deep neural network (DNN)-based speech enhancement ordinarily requires clean speech signals as the training target. However, collecting clean signals is very costly because they must be recorded in a studio. This requirement currently restricts the amount of training data for speech enhancement to less than 1/1000 of that of speech recognition which does not need clean signals. Increasing the amount of training data is important for improving the performance, and hence the requirement of clean signals should be relaxed. In this paper, we propose a training strategy that does not require clean signals. The proposed method only utilizes noisy signals for training, which enables us to use a variety of speech signals in the wild. Our experimental results showed that the proposed method can achieve the performance similar to that of a DNN trained with clean signals.
研究动机与目标
- 解决深度神经网络语音增强中干净语音数据成本高且稀缺的问题。
- 通过仅使用含噪信号进行训练,消除对录音室录制的干净语音的需求。
- 研究在缺乏干净数据时,含噪信号是否可作为有效的训练目标。
- 确定在何种条件下,噪声目标训练可实现与干净目标训练相当的性能。
- 分析噪声分布和信噪比(SNR)对所提方法有效性的影响。
提出的方法
- 该方法使用一个深度神经网络,从更严重失真的版本 $\bm{x}' = \bm{x} + \bm{n}$ 中预测原始含噪信号 $\bm{x} = \bm{s} + \bm{n}^{(\text{obs})}$,其中 $\bm{n}$ 为额外添加的噪声。
- 训练数据通过向现有含噪信号 $\bm{x}$ 添加不同噪声 $\bm{n}$ 生成,避免了对干净语音的需求。
- 该方法受 Noise2Noise 启发,但针对语音任务进行了调整,即目标为含噪而非干净信号。
- 模型仅学习去除额外噪声 $\bm{n}$,同时保留原始噪声 $\bm{n}^{(\text{obs})}$。
- 该方法依赖于假设额外噪声 $\bm{n}$ 的分布与观测噪声 $\bm{n}^{(\text{obs})}$ 的分布存在重叠。
- 实验采用基于短时傅里叶变换(STFT)的时频掩码估计,评估指标为 SI-SDR 和 PESQ。
实验结果
研究问题
- RQ1能否在完全不使用干净语音目标的情况下,有效训练深度神经网络进行语音增强?
- RQ2当噪声目标信号的信噪比(SNR)达到多少时,NyTT 能够实现与干净目标训练相当的性能?
- RQ3额外噪声 $\bm{n}$ 的分布如何影响 NyTT 的性能?
- RQ4当训练与测试数据分布不匹配时,NyTT 是否比标准训练具有更好的泛化能力?
- RQ5SNR ≥ 15 dB 的含噪信号是否可作为训练中干净语音的有效替代?
主要发现
- 当使用 TAU-2020 作为额外噪声时,NyTT 在 SI-SDR 上实现了 12.09 dB 的提升,接近干净目标训练的 12.18 dB。
- 当含噪目标 $\bm{x}$ 的 SNR 为 15 dB 或更高时,NyTT 的性能几乎与干净目标训练无法区分。
- 当 $\bm{x}$ 的 SNR 低于 0 dB 时,性能显著下降,表明该方法存在一个性能失效的阈值。
- 使用 Task2 噪声(办公室声音事件)时,NyTT 表现较差(SI-SDR 为 9.63 dB),因为其噪声分布与 $\bm{n}^{(\text{obs})}$ 无重叠。
- t-SNE 可视化结果证实,有效噪声类型(DEMAND、TAU-2020、CHiME3)与 $\bm{n}^{(\text{obs})}$ 的分布存在重叠,而 Task2 则无重叠。
- 该方法成功在无干净语音的情况下训练了深度神经网络,在数据分布不匹配条件下实现了与干净目标训练相当的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。