Skip to main content
QUICK REVIEW

[论文解读] Attention is All You Need in Speech Separation

Cem Subakan, Mirco Ravanelli|arXiv (Cornell University)|Oct 25, 2020
Speech and Audio Processing参考文献 32被引用 10
一句话总结

本文提出 SepFormer,一种无需循环神经网络(RNN)的基于 Transformer 的单通道语音分离架构,通过多尺度自注意力机制替代循环网络。通过采用双路处理与步长下采样,该模型在 WSJ0-2mix 数据集上达到 22.3 dB 的 SI-SNRi,在 WSJ0-3mix 数据集上达到 19.5 dB,性能达到当前最先进水平,同时实现了完全并行化计算,显著减少了训练时间与显存占用,相比 RNN 模型具有明显优势。

ABSTRACT

Recurrent Neural Networks (RNNs) have long been the dominant architecture in sequence-to-sequence learning. RNNs, however, are inherently sequential models that do not allow parallelization of their computations. Transformers are emerging as a natural alternative to standard RNNs, replacing recurrent computations with a multi-head attention mechanism. In this paper, we propose the SepFormer, a novel RNN-free Transformer-based neural network for speech separation. The SepFormer learns short and long-term dependencies with a multi-scale approach that employs transformers. The proposed model achieves state-of-the-art (SOTA) performance on the standard WSJ0-2/3mix datasets. It reaches an SI-SNRi of 22.3 dB on WSJ0-2mix and an SI-SNRi of 19.5 dB on WSJ0-3mix. The SepFormer inherits the parallelization advantages of Transformers and achieves a competitive performance even when downsampling the encoded representation by a factor of 8. It is thus significantly faster and it is less memory-demanding than the latest speech separation systems with comparable performance.

研究动机与目标

  • 开发一种摒弃循环神经网络(RNN)的语音分离模型,以实现计算的完全并行化。
  • 在标准的 WSJ0-2mix 与 WSJ0-3mix 数据集上实现最先进性能,且不依赖 RNN 结构。
  • 通过降低显存占用与推理时间,提升计算效率,同时保持高分离质量。
  • 探究多尺度自注意力机制在建模语音信号中短期与长期依赖关系方面的有效性。
  • 证明纯 Transformer 架构在单通道语音分离任务中可超越 RNN 模型。

提出的方法

  • 模型采用可学习域掩码框架,使用全卷积编码器从输入混合信号中提取时频表征。
  • 掩码网络基于双路 Transformer 架构构建,其中局部与全局依赖关系分别通过独立的 Intra- 和 Inter-Transformer 模块建模。
  • Intra-Transformer 并行处理局部块,而 Inter-Transformer 则跨块关注以建模长程上下文,二者均采用多头自注意力机制。
  • 编码器中采用步长为 8 的下采样策略,减少序列长度,从而在几乎不损失性能的前提下实现更快推理。
  • 引入动态混合策略以提升泛化能力,解码器通过重叠相加法结合可学习掩码重建时域语音源。
  • 模型采用端到端训练方式,损失函数为 SI-SNR,训练中使用自动混合精度与批量大小为 1 以保证公平比较。

实验结果

研究问题

  • RQ1纯 Transformer 架构是否能在不使用 RNN 的情况下实现单通道语音分离的最先进性能?
  • RQ2在双路框架中,多尺度自注意力机制与 RNN 相比,在建模语音分离中的长期依赖关系方面表现如何?
  • RQ3对编码表示下采样 8 倍在性能与效率方面的影响程度如何?
  • RQ4与基于 RNN 的模型相比,Transformer 的并行化能力是否能显著缩短训练与推理时间?
  • RQ5在自注意力机制背景下,动态混合策略是否能提升泛化能力?

主要发现

  • SepFormer 在 WSJ0-2mix 数据集上达到 22.3 dB 的 SOTA SI-SNRi,优于以往的 RNN 基模型。
  • 在 WSJ0-3mix 数据集上,模型达到 19.5 dB 的 SI-SNRi 与 19.7 dB 的 SDRi,创下新的 SOTA 基准。
  • 训练速度显著快于 DPRNN 与 DPTNet,在 24 小时内即达到 17 dB SI-SNRi,而 DPRNN 需要两天时间。
  • 推理速度远快于 DPRNN、DPTNet 与 Wavesplit,且显存占用更低,即使参数量达 2600 万也表现优异。
  • 在编码器中采用步长 8 时,模型仍保持优异性能,有效缩短序列长度并加速计算。
  • 动态混合策略提升性能,且在更高下采样率下性能下降极小,而 RNN 对应模型则表现明显退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。