Skip to main content
QUICK REVIEW

[论文解读] Multitask learning for instrument activation aware music source separation

Yun-Ning Hung, Alexander Lerch|arXiv (Cornell University)|Aug 2, 2020
Music and Audio Processing被引用 8
一句话总结

本文提出一种多任务深度学习模型,联合执行乐器激活检测(IAD)与音乐源分离,利用推理过程中预测的乐器活动作为动态谱权重,以提升分离质量。该模型在包含六种乐器的混合MedleyDB与Mixing Secrets数据集上优于Open-Unmix,表明整合IAD可通过对错误掩码预测的校正来提升源分离性能。

ABSTRACT

Music source separation is a core task in music information retrieval which has seen a dramatic improvement in the past years. Nevertheless, most of the existing systems focus exclusively on the problem of source separation itself and ignore the utilization of other~---possibly related---~MIR tasks which could lead to additional quality gains. In this work, we propose a novel multitask structure to investigate using instrument activation information to improve source separation performance. Furthermore, we investigate our system on six independent instruments, a more realistic scenario than the three instruments included in the widely-used MUSDB dataset, by leveraging a combination of the MedleyDB and Mixing Secrets datasets. The results show that our proposed multitask model outperforms the baseline Open-Unmix model on the mixture of Mixing Secrets and MedleyDB dataset while maintaining comparable performance on the MUSDB dataset.

研究动机与目标

  • 探究通过多任务学习,乐器激活检测(IAD)是否可提升音乐源分离性能。
  • 将源分离任务从标准的四乐器设置(如MUSDB)扩展至最多六种乐器,使用更大规模的开放数据集。
  • 探索在推理过程中将IAD预测结果作为动态权重,以优化源分离掩码。
  • 在混合数据集(MedleyDB + Mixing Secrets)上评估模型,以提升训练多样性与真实性。
  • 提供首个可分离最多六种乐器的开源模型,突破MUSDB基准中三个独立乐器的限制。

提出的方法

  • 源分离与乐器激活检测采用共享编码器-解码器架构,共享低层特征提取,任务特定头独立设计。
  • 模型通过端到端训练,采用多任务损失函数,结合均方误差(MSE)用于谱图重建,以及二元交叉熵(BCE)用于乐器激活预测。
  • 推理阶段,利用预测的乐器活动得分作为帧级权重,抑制目标乐器不存在区域的估计掩码。
  • 对预测的乐器活动标签应用中值滤波,以减少虚假的误报与漏报。
  • 利用MM数据集(MedleyDB + Mixing Secrets)提升训练数据多样性,并支持六乐器分离任务。
  • 采用标准指标(SDR、SIR、SAR)评估性能,并通过消融实验比较有无乐器加权的模型表现。

实验结果

研究问题

  • RQ1联合训练乐器激活检测与音乐源分离是否可提升源分离性能?
  • RQ2在推理过程中使用预测的乐器活动作为谱权重,对分离质量有何影响?
  • RQ3采用IAD的多任务学习是否能提升在四类以上乐器数据集上的泛化能力?
  • RQ4对乐器预测结果进行后处理(如中值滤波)对最终分离性能有何影响?
  • RQ5与Open-Unmix相比,该模型在包含六种乐器的更大、更多样化数据集上的表现如何?

主要发现

  • 采用乐器活动加权的多任务模型在混合MedleyDB与Mixing Secrets数据集上的平均SDR、SIR与SAR均高于基线模型Open-Unmix。
  • 将预测的乐器活动作为权重可提升分离质量,通过校正错误的掩码预测,尤其显著降低干扰(SIR提升最大)。
  • 对预测的乐器活动进行中值滤波可为所有乐器带来一致的性能增益,表明对噪声预测具有鲁棒性。
  • 使用真实标签作为权重可达到最高性能,作为性能上限,验证了所提加权机制的潜力。
  • 该模型在MM数据集上优于Open-Unmix,同时在标准MUSDB数据集上保持相当的性能,证明了其跨数据集的泛化能力。
  • 尽管在多任务损失下源分离质量略有下降,但推理阶段的加权机制带来了净性能提升,验证了多任务设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。