Skip to main content
QUICK REVIEW

[论文解读] LaFurca: Iterative Refined Speech Separation Based on Context-Aware Dual-Path Parallel Bi-LSTM

Ziqiang Shi, Rujie Liu|arXiv (Cornell University)|Jan 23, 2020
Speech and Audio Processing参考文献 30被引用 7
一句话总结

该论文提出LaFurca,一种基于上下文感知双路并行BiLSTM网络的新型端到端时域语音分离模型,结合迭代多阶段优化。通过引入内部与跨并行BiLSTM模块、全局上下文感知能力以及螺旋式多阶段优化,LaFurca在WSJ0-2mix数据集上实现了SOTA性能,SDRi达到20.55 dB,SI-SDR达到20.35 dB,较之前方法提升超过1.5 dB。

ABSTRACT

Deep neural network with dual-path bi-directional long short-term memory (BiLSTM) block has been proved to be very effective in sequence modeling, especially in speech separation, e.g. DPRNN-TasNet \cite{luo2019dual}. In this paper, we propose several improvements of dual-path BiLSTM based network for end-to-end approach to monaural speech separation. Firstly a dual-path network with intra-parallel BiLSTM and inter-parallel BiLSTM components is introduced to reduce performance sub-variances among different branches. Secondly, we propose to use global context aware inter-intra cross-parallel BiLSTM to further perceive the global contextual information. Finally, a spiral multi-stage dual-path BiLSTM is proposed to iteratively refine the separation results of the previous stages. All these networks take the mixed utterance of two speakers and map it to two separate utterances, where each utterance contains only one speaker's voice. For the objective, we propose to train the network by directly optimizing the utterance level scale-invariant signal-to-distortion ratio (SI-SDR) in a permutation invariant training (PIT) style. Our experiments on the public WSJ0-2mix data corpus results in 20.55dB SDR improvement, 20.35dB SI-SDR improvement, 3.69 of PESQ, and 94.86\% of ESTOI, which shows our proposed networks can lead to performance improvement on the speaker separation task. We have open-sourced our re-implementation of the DPRNN-TasNet in https://github.com/ShiZiqiang/dual-path-RNNs-DPRNNs-based-speech-separation, and our LaFurca is realized based on this implementation of DPRNN-TasNet, it is believed that the results in this paper can be reproduced with ease.

研究动机与目标

  • 为解决基于STFT的语音分离方法存在的相位不匹配和信号表示次优等问题。
  • 通过增强序列建模能力的端到端时域建模,提升单通道语音分离性能。
  • 通过共享权重矩阵和特征平均,减少双路BiLSTM架构中并行分支之间的性能差异。
  • 通过引入跨并行BiLSTM连接,增强全局上下文感知能力。
  • 通过多阶段双路BiLSTM设计,实现分离结果的迭代优化。

提出的方法

  • 模型采用双路BiLSTM结构,包含内部并行和跨并行BiLSTM组件,通过共享权重矩阵和特征图平均,降低各分支间的性能差异。
  • 引入全局上下文感知的跨并行内部-跨并行BiLSTM模块,通过允许内部与跨并行分支之间的相互参考,增强长距离上下文建模能力。
  • 设计螺旋式多阶段双路BiLSTM架构,通过将前一阶段的输出作为下一阶段的输入,实现分离结果的迭代优化,每个阶段均使用原始混合信号和前一阶段的估计结果。
  • 采用置换不变训练(PIT)进行网络训练,以直接优化语音级尺度不变信噪比(SI-SDR)。
  • 模型作为DPRNN-TasNet框架的扩展实现,代码已在GitHub公开,便于复现。
  • 训练过程采用多阶段迭代优化策略,每一阶段均在前一阶段基础上改进,最终阶段达到最佳性能。

实验结果

研究问题

  • RQ1具有共享权重的并行BiLSTM模块是否能降低基于双路BiLSTM语音分离方法中各分支的性能差异?
  • RQ2通过引入跨并行内部-跨并行BiLSTM连接实现全局上下文感知,是否能提升分离质量?
  • RQ3采用双路BiLSTM模块的迭代多阶段优化是否能在端到端语音分离中带来稳定性能提升?
  • RQ4在WSJ0-2mix数据集上,所提出的LaFurca模型在SDRi、SI-SDR、PESQ和ESTOI指标上与SOTA方法相比如何?
  • RQ5在GPU显存受限条件下,结合并行性、上下文感知与迭代优化,模型性能可提升至何种程度?

主要发现

  • LaFurca在WSJ0-2mix数据集上实现了20.55 dB SDRi和20.35 dB SI-SDR的新SOTA性能,显著优于先前方法。
  • 8和9阶段的模型(LaFurca(8,9))表现最佳,证明了深度多阶段迭代优化的有效性。
  • 消融实验证实,每个组件——并行BiLSTM、上下文感知双路结构与迭代优化——均对性能提升有贡献,LaFurca(6,6)相比DPRNN-TasNet提升0.6 dB SDRi。
  • LaFurca实现3.69 PESQ和94.86% ESTOI,表明分离语音具有高主观质量与可懂度。
  • 训练曲线显示,两阶段已足够收敛,表明更深的堆叠并非总是必需,但在计算资源允许时可带来显著收益。
  • 模型性能超过STFT-based方法的上限7.5 dB以上,证实了端到端时域学习的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。