Skip to main content
QUICK REVIEW

[论文解读] Joint Separation and Denoising of Noisy Multi-talker Speech using Recurrent Neural Networks and Permutation Invariant Training

Morten Kolbæk, Dong Yu|VBN Forskningsportal (Aalborg Universitet)|Aug 31, 2017
Speech and Audio Processing参考文献 22被引用 6
一句话总结

该论文提出了一种联合语音分离与去噪框架,采用双向LSTM RNN,并通过话语级置换不变训练(uPIT)在噪声环境下的多说话人场景中进行训练。该方法在多种噪声类型和信噪比(SNR)下显著提升了SDR和ESTOI指标,对未见噪声具有良好的泛化能力,并且无需事先知晓说话人数量即可处理双人和三人说话人混合信号。

ABSTRACT

In this paper we propose to use utterance-level Permutation Invariant Training (uPIT) for speaker independent multi-talker speech separation and denoising, simultaneously. Specifically, we train deep bi-directional Long Short-Term Memory (LSTM) Recurrent Neural Networks (RNNs) using uPIT, for single-channel speaker independent multi-talker speech separation in multiple noisy conditions, including both synthetic and real-life noise signals. We focus our experiments on generalizability and noise robustness of models that rely on various types of a priori knowledge e.g. in terms of noise type and number of simultaneous speakers. We show that deep bi-directional LSTM RNNs trained using uPIT in noisy environments can improve the Signal-to-Distortion Ratio (SDR) as well as the Extended Short-Time Objective Intelligibility (ESTOI) measure, on the speaker independent multi-talker speech separation and denoising task, for various noise types and Signal-to-Noise Ratios (SNRs). Specifically, we first show that LSTM RNNs can achieve large SDR and ESTOI improvements, when evaluated using known noise types, and that a single model is capable of handling multiple noise types with only a slight decrease in performance. Furthermore, we show that a single LSTM RNN can handle both two-speaker and three-speaker noisy mixtures, without a priori knowledge about the exact number of speakers. Finally, we show that LSTM RNNs trained using uPIT generalize well to noise types not seen during training.

研究动机与目标

  • 解决在真实噪声环境中同时进行语音分离与去噪的挑战,突破理想无噪声条件的限制。
  • 通过uPIT克服说话人无关的多说话人分离中的标签置换问题,实现在正确说话人分配下的端到端训练。
  • 评估模型在不同噪声类型、信噪比(SNR)以及说话人数量(双人与三人混合)下的鲁棒性与泛化能力。
  • 证明单一深度学习模型可在无需微调或事先知晓说话人数量的情况下处理多种噪声类型与说话人数量。
  • 研究uPIT训练的双向LSTM网络在真实应用场景下的性能表现,包括合成噪声与真实生活噪声信号。

提出的方法

  • 采用双向长短期记忆(LSTM)循环神经网络,以建模单通道多说话人语音混合信号中的时序依赖性。
  • 应用话语级置换不变训练(uPIT),联合优化说话人分配与信号重建,解决训练过程中的标签置换问题。
  • 在包含语音与多种噪声类型(合成与真实生活噪声)的混合信号上进行训练,覆盖多个信噪比(SNR)。
  • 使用短时傅里叶变换(STFT)将输入与输出信号表示为频域形式,以支持谱掩码与损失计算。
  • 通过损失函数选择使整体重建误差最小化的估计源信号的置换方式。
  • 采用信号失真比(SDR)与扩展短时客观可懂度(ESTOI)指标,在多样化测试条件下评估模型性能。

实验结果

研究问题

  • RQ1uPIT训练的双向LSTM网络是否能在噪声多说话人语音场景中实现稳健的联合分离与去噪?
  • RQ2模型性能在不同噪声类型与信噪比(SNR)下如何变化,包括推理阶段遇到的未见噪声?
  • RQ3单一模型在未事先知晓说话人数量的情况下,对双人与三人说话人混合信号的泛化能力达到何种程度?
  • RQ4当在训练数据中未出现的真实生活噪声信号上进行测试时,模型表现如何?
  • RQ5与仅使用单一噪声类型训练相比,混合多种噪声类型进行训练对泛化能力与性能有何影响?

主要发现

  • 使用uPIT训练的双向LSTM RNN在多种噪声类型与信噪比(SNR)下均实现了SDR与ESTOI的显著提升,即使在具有挑战性的条件下亦表现优异。
  • 在多种噪声类型上进行训练的模型,其性能仅比在单一噪声类型上训练的模型略有下降,表现出强大的鲁棒性。
  • 单一uPIT训练模型无需事先知晓说话人数量,即可成功处理双人与三人说话人混合信号,展现出强大的泛化能力。
  • 模型对未见噪声类型(包括真实生活噪声如babble、street与car噪声)具有良好的泛化能力,性能下降极小。
  • 平均而言,表现最佳的模型(LSTM5)在所有测试集上实现了平均0.15的ESTOI提升,部分条件下提升超过0.30。
  • 在BUS与PED测试集上,LSTM5分别实现了平均0.12与0.10的ESTOI提升,表明其在真实噪声环境下的优异表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。