Skip to main content
QUICK REVIEW

[论文解读] FurcaNet: An end-to-end deep gated convolutional, long short-term memory, deep neural networks for single channel speech separation

Ziqiang Shi, Huibin Lin|arXiv (Cornell University)|Feb 2, 2019
Speech and Audio Processing参考文献 25被引用 15
一句话总结

FurcaNet 是一种用于单通道语音分离的端到端深度学习模型,结合了门控卷积神经网络(GCNN)、双向LSTM(BiLSTM)和深度神经网络(DNN),可直接处理原始音频波形。它通过排列不变训练(PIT)优化话语级信噪比(SDR),在 WSJ0-2mix 数据集上实现了 13.3 dB 的 SDR 提升,超越了先前的最先进方法,并打破了基于 STFT 的性能上限。

ABSTRACT

Deep gated convolutional networks have been proved to be very effective in single channel speech separation. However current state-of-the-art framework often considers training the gated convolutional networks in time-frequency (TF) domain. Such an approach will result in limited perceptual score, such as signal-to-distortion ratio (SDR) upper bound of separated utterances and also fail to exploit an end-to-end framework. In this paper we present an integrated simple and effective end-to-end approach to monaural speech separation, which consists of deep gated convolutional neural networks (GCNN) that takes the mixed utterance of two speakers and maps it to two separated utterances, where each utterance contains only one speaker's voice. In addition long short-term memory (LSTM) is employed for long term temporal modeling. For the objective, we propose to train the network by directly optimizing utterance level SDR in a permutation invariant training (PIT) style. Our experiments on the public WSJ0-2mix data corpus demonstrate that this new scheme can produce more discriminative separated utterances and leading to performance improvement on the speaker separation task.

研究动机与目标

  • 为了解决基于 STFT 的语音分离方法的局限性,这些方法由于相位失配和次优信号变换,对 SDR 性能施加了上限。
  • 开发一个完全端到端的框架,直接处理原始音频波形,避免使用中间的时间-频率域表示。
  • 通过优化感知指标(如 SDR)而非依赖掩码或嵌入损失函数,提升语音分离性能。
  • 通过引入基于重新初始化的训练技巧,克服 SDR 优化中的训练不稳定性,以逃逸局部极小值。
  • 证明使用 GCNN 和 BiLSTM 的端到端时域学习方法在干净和噪声条件下均能超越基于 STFT 的基线方法。

提出的方法

  • 模型使用五层一维门控卷积层(GConv),核大小分别为 80 和 1000,随后应用层归一化以稳定训练。
  • 在 GCNN 之后应用双向长短期记忆(BiLSTM)层,每方向包含 1000 个单元,用于长期时间建模。
  • 使用两层全连接神经网络(DNN),每层含 2000 个神经元,处理最终表示以生成两个分离的语音波形。
  • 损失函数为排列不变的 SDR(uSDR),在训练过程中最小化最佳性能说话人排列的负 SDR。
  • 采用一种训练技巧:若验证集上的初始 SDR 超过阈值(例如 -30 dB),则重新初始化并重新训练网络,以避免陷入局部极小值。
  • 使用 Adam 优化器进行训练,学习率呈衰减趋势,使用包含 8 个话语的迷你批次。

实验结果

研究问题

  • RQ1端到端时域语音分离模型能否在 SDR 性能上超越基于 STFT 的方法?
  • RQ2将门控卷积神经网络与双向 LSTM 结合,是否能通过捕捉局部和长程时间依赖性来提升语音分离性能?
  • RQ3通过排列不变训练直接优化话语级 SDR,是否能带来优于基于掩码或聚类方法的分离质量?
  • RQ4尽管 SDR 作为损失函数具有非可微性和不稳定性,是否仍能有效训练 SDR 优化网络?
  • RQ5所提出的架构是否能泛化到未见说话人,并实现说话人无关的性能?

主要发现

  • FurcaNet 在 WSJ0-2mix 数据集上实现了 13.3 dB 的 SDR 提升,显著优于先前最先进方法 Chimera++(12.0 dB)。
  • 该模型打破了基于 STFT 方法的性能上限,后者受限于理想比值掩码(IRM)的 12.7 dB SDRi 性能。
  • uSDR 损失函数结合重新初始化训练技巧,可实现向更高 SDR 值的收敛,避免标准训练中陷入局部极小值。
  • 端到端时域方法消除了对 STFT、相位假设和逆 STFT 的依赖,减少了近似误差并提升了主观质量。
  • GCNN、BiLSTM 和 DNN 在单一架构中的整合,有效建模了混合语音中的频谱与时间结构。
  • 该模型在未见说话人上表现出鲁棒性,证实了其说话人无关的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。