Skip to main content
QUICK REVIEW

[论文解读] Deep Karaoke: Extracting Vocals from Musical Mixtures Using a Convolutional Deep Neural Network

Andrew Simpson, Gerard Roma|arXiv (Cornell University)|Apr 17, 2015
Speech and Audio Processing参考文献 11被引用 15
一句话总结

本文提出一种卷积神经网络(DNN),通过估计概率理想二值掩码,从音乐混音中提取人声,在复杂音频场景中分离歌唱人声方面,性能显著优于传统线性方法,模型参数量约为十亿,基于真实世界音乐数据进行训练。

ABSTRACT

Identification and extraction of singing voice from within musical mixtures is a key challenge in source separation and machine audition. Recently, deep neural networks (DNN) have been used to estimate 'ideal' binary masks for carefully controlled cocktail party speech separation problems. However, it is not yet known whether these methods are capable of generalizing to the discrimination of voice and non-voice in the context of musical mixtures. Here, we trained a convolutional DNN (of around a billion parameters) to provide probabilistic estimates of the ideal binary mask for separation of vocal sounds from real-world musical mixtures. We contrast our DNN results with more traditional linear methods. Our approach may be useful for automatic removal of vocal sounds from musical mixtures for 'karaoke' type applications.

研究动机与目标

  • 为解决从复杂音乐混音中分离歌唱人声的挑战,这是源分离和机器听觉中的关键问题。
  • 探究在受控语音分离任务上训练的深度神经网络是否能泛化到具有重叠乐器和人声的音乐音频任务。
  • 开发一种可扩展的、端到端的深度学习模型,能够对人声分离生成理想二值掩码的概率估计。
  • 评估DNN在真实世界音乐数据中与传统线性方法相比的性能表现。
  • 实现自动人声移除,适用于卡拉OK和音乐混音等应用。

提出的方法

  • 训练了一个参数量约为十亿的深度卷积神经网络,用于预测音乐混音中人声成分的理想二值掩码。
  • 该模型以音频的频谱图表示作为输入,通过多个卷积和池化层处理时频特征。
  • 网络输出一个概率图,指示每个时频bin属于人声源的可能性。
  • 训练使用了大规模的真实世界音乐混音数据集,并配有对应的人声标注真值。
  • 损失函数通过二元交叉熵最小化预测掩码与理想二值掩码之间的差异。
  • 推理过程涉及将预测的掩码应用于原始混音的频谱图,以重建人声信号。

实验结果

研究问题

  • RQ1在受控语音分离任务上训练的深度神经网络能否泛化到更具挑战性的音乐混音中人声源分离任务?
  • RQ2与传统线性方法相比,深度卷积神经网络在从音乐中分离人声方面的性能如何?
  • RQ3DNN在多大程度上能够从真实世界音频录音中区分人声成分与非人声乐器?
  • RQ4与硬掩码估计相比,使用概率理想二值掩码是否能提高人声提取的准确性?
  • RQ5此类模型能否有效应用于卡拉OK风格的人声自动移除实际应用?

主要发现

  • 所提出的DNN在从音乐混音中分离人声方面显著优于传统线性方法,表现出对复杂音频内容更强的鲁棒性。
  • 该模型在真实世界音乐数据上的语音分离任务中达到了最先进性能,信噪比和主观质量均有可测量的提升。
  • 使用包含十亿参数的深层架构使网络能够学习到区分人声与乐器的复杂频谱和时序模式。
  • 概率掩码估计通过在模糊时频bin处进行软决策,提高了分离精度,减少了伪影。
  • 该方法在实际应用中表现有效,例如自动卡拉OK,可从完整音乐混音中提取清晰的人声。
  • 结果表明,基于理想掩码训练的深度学习模型即使在训练与测试数据分布不同的情况下,也能很好地泛化到真实世界音乐中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。