Skip to main content
QUICK REVIEW

[论文解读] WildMix Dataset and Spectro-Temporal Transformer Model for Monoaural Audio Source Separation

Amir Zadeh, Tianjun Ma|arXiv (Cornell University)|Nov 21, 2019
Speech and Audio Processing参考文献 23被引用 6
一句话总结

本文提出了WildMix,一个包含25种声音类别的多样化单声道音频源分离数据集,其混合方式复杂且任意,同时提出了Spectro-Temporal Transformer(STT)模型,一种基于Transformer的新架构,其Spectro-Temporal编码器(STE)通过在时域和频域同时建模长程依赖关系,实现对源信号的有效解耦。STT在WildMix数据集上取得了最先进性能,在所有子数据集上均显著优于先前基线模型。

ABSTRACT

Monoaural audio source separation is a challenging research area in machine learning. In this area, a mixture containing multiple audio sources is given, and a model is expected to disentangle the mixture into isolated atomic sources. In this paper, we first introduce a challenging new dataset for monoaural source separation called WildMix. WildMix is designed with the goal of extending the boundaries of source separation beyond what previous datasets in this area would allow. It contains diverse in-the-wild recordings from 25 different sound classes, combined with each other using arbitrary composition policies. Source separation often requires modeling long-range dependencies in both temporal and spectral domains. To this end, we introduce a novel trasnformer-based model called Spectro-Temporal Transformer (STT). STT utilizes a specialized encoder, called Spectro-Temporal Encoder (STE). STE highlights temporal and spectral components of sources within a mixture, using a self-attention mechanism. It subsequently disentangles them in a hierarchical manner. In our experiments, STT swiftly outperforms various previous baselines for monoaural source separation on the challenging WildMix dataset.

研究动机与目标

  • 为解决现有单声道源分离数据集缺乏多样性、无法覆盖标准鸡尾酒会或音乐分离场景之外的真实世界复杂情况的问题。
  • 开发一种深度学习模型,能够捕捉复杂音频混合中长程的时域与频域依赖关系。
  • 设计一种专为在频时域中解耦重叠源信号而优化的基于Transformer的架构。
  • 在反映真实世界听觉复杂性的挑战性、多样化数据集上评估模型性能。

提出的方法

  • 提出WildMix,一个包含25种声音类别的新数据集,通过任意的起始时间与音量组合生成真实、复杂的混合音频。
  • 提出Spectro-Temporal Transformer(STT),一种基于Transformer的模型,配备专用的Spectro-Temporal编码器(STE),可分别但联合处理时域与频域。
  • 在STE中引入自注意力机制,以突出输入谱图中的相关频带行与时间列,实现对时空依赖关系的联合建模。
  • 在STE中采用双路径架构:一条路径用于时域建模,另一条用于频域建模,两者均通过卷积层与多头自注意力机制增强。
  • 在解码器头部应用掩码机制,以确保源波形的自回归生成,提升重建保真度。
  • 在12块Tesla V100 GPU上进行了为期1.5个月的超参数大规模搜索,以优化模型性能。

实验结果

研究问题

  • RQ1基于Transformer的模型能否在包含多样化声音类别的复杂真实世界单声道混合音频中,有效解耦重叠的音频源?
  • RQ2Spectro-Temporal编码器(STE)中独立的时域与频域建模路径相较于标准Transformer编码器,在源分离性能上带来了哪些贡献?
  • RQ3所提出的STT模型在不同源数量(2、3、5)及源类别组合(跨类、同类、混合)下是否具备良好的泛化能力?
  • RQ4STT中各组件(如CNN、多头归一化、掩码机制)对整体性能的贡献如何?

主要发现

  • STT在WildMix的所有子数据集上均取得最佳性能,其在含2个源的Hybrid子集上的平均SDR达到9.578。
  • 完整STT模型优于所有消融实验变体,表明所有组件——尤其是双路径STE、CNN以及解码器中的掩码机制——对实现最优性能至关重要。
  • 消融研究显示,若移除频域路径(仅时域路径)或时域路径(仅频域路径),性能均下降,证实了联合建模的重要性。
  • STT显著优于基于RNN的模型(如DRNN、SRNN),甚至优于基于LSTM的模型(如L2L和OTF),凸显了Transformer架构在此任务中的优越性。
  • 随着源数量的增加(从2个增至5个),性能有所下降,证实了任务复杂度的提升,但STT在所有设置下仍保持强劲性能。
  • 同类别子集(intraclass)略难于跨类别(interclass)或混合(hybrid)子集,可能是因为同类别源之间相似度更高,导致解耦难度更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。