Skip to main content
QUICK REVIEW

[论文解读] Bootstrapping deep music separation from primitive auditory grouping principles

Prem Seetharaman, Gordon Wichern|arXiv (Cornell University)|Oct 23, 2019
Speech and Audio Processing参考文献 26被引用 6
一句话总结

本文提出一种自监督方法,通过利用多种原始听觉分组线索(如音高接近度、重复性、音色)在无真实标签的情况下训练深度音乐源分离模型。该方法利用一组原始算法的置信度估计,从无标签的YouTube音乐混音中筛选出高质量的源分离结果,将其混音生成合成训练数据,并微调一个深度聚类网络——在MUSDB测试集上达到3.39 dB SDR,优于原始算法集成模型,且接近有监督基线模型的性能。

ABSTRACT

Separating an audio scene such as a cocktail party into constituent, meaningful components is a core task in computer audition. Deep networks are the state-of-the-art approach. They are trained on synthetic mixtures of audio made from isolated sound source recordings so that ground truth for the separation is known. However, the vast majority of available audio is not isolated. The brain uses primitive cues that are independent of the characteristics of any particular sound source to perform an initial segmentation of the audio scene. We present a method for bootstrapping a deep model for music source separation without ground truth by using multiple primitive cues. We apply our method to train a network on a large set of unlabeled music recordings from YouTube to separate vocals from accompaniment without the need for ground truth isolated sources or artificial training mixtures.

研究动机与目标

  • 解决深度源分离模型依赖于带真实隔离源的合成混音的问题,而这些数据在大多数真实音频中不可用。
  • 实现在无隔离源录音的情况下,基于大规模无标签音频数据集(如YouTube)训练深度神经网络。
  • 为基于原始方法的分离输出开发一种置信度度量,可在无真实标签的情况下预测性能,从而筛选出高质量的训练样本。
  • 证明通过原始聚类筛选出的高置信度源分离结果生成的自举模型,其性能可接近有监督基线。

提出的方法

  • 对原始音乐混音应用多种原始听觉分组算法(如HPSS用于分离谐波/打击乐成分,Melodia用于音高接近度,2DFT-M/R用于微调制和重复性),生成软时频掩码。
  • 将这些原始算法的输出整合为每个时频点的二维嵌入空间,其中每个维度对应一个原始算法的分割决策。
  • 利用得到的原始聚类生成来自无标签音乐混音的初始源估计(人声与伴奏)。
  • 开发一种基于原始决策在时频点间一致性的置信度度量,该度量与分离质量相关(在MUSDB上与SDR的皮尔逊相关系数r = 0.56)。
  • 按置信度将源估计分为四分位数,并将高置信度源(Q2–Q4)混音生成20,000个合成训练混音用于深度学习。
  • 使用幅度权重和ADAM优化器,在混音数据上训练一个深度聚类网络(4层BLSTM,20维嵌入)的标准目标函数。

实验结果

研究问题

  • RQ1能否有效结合多种原始听觉分组线索,在无真实标签的情况下生成高质量的初始源分离结果?
  • RQ2能否从原始聚类中衍生出一种置信度度量,以在不依赖真实标签的情况下预测实际分离质量?
  • RQ3能否利用原始聚类生成的高置信度源估计,生成合成训练数据,使深度网络在未见混音上实现良好泛化?
  • RQ4增加训练数据的多样性与规模(如来自YouTube)是否能提升自举深度源分离模型的性能?
  • RQ5通过此自监督流程训练的模型能否实现与有监督基线模型相当的性能?

主要发现

  • 从原始聚类中衍生出的置信度度量在MUSDB训练集上与实际分离性能呈中等相关性(r = 0.56),可有效筛选出低质量训练样本。
  • 在原始聚类输出中最高置信度四分位数(Q4)的混音数据上训练的深度网络在MUSDB测试集上达到3.39 dB SDR,优于原始聚类基线模型(2.93 dB SDR)。
  • 在MUSDB和YouTube(额外831首歌曲)数据上联合训练的模型达到3.39 dB SDR,表明数据多样性可提升性能。
  • 随着训练数据规模的增加,自举模型(3.39 dB SDR)与有监督真实标签网络之间的性能差距缩小,但依然显著。
  • 仅在MUSDB混音数据上训练的模型性能劣于原始聚类基线模型(2.71 dB vs 2.93 dB SDR),表明数据多样性对成功至关重要。
  • 该方法使任何无标签音频混音均可用于训练深度源分离模型,为从真实音频中实现持续的自监督学习开辟了道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。