Skip to main content
QUICK REVIEW

[论文解读] Benchmarks and leaderboards for sound demixing tasks

Roman Solovyev, Alexander Stempkovskiy|arXiv (Cornell University)|May 12, 2023
Speech and Audio Processing被引用 6
一句话总结

本论文提出了两个新的基准数据集——Synth MVSep 和 Multisong MVSep——用于声音源分离,并提供了一个动态排行榜(https://mvsep.com/quality_checker/)。论文提出了一种基于声乐与乐器模型(UVR-MDX1、UVR-MDX2、Demucs4)的茎干特定模型集成方法,结合测试时增强与加权平均,最终在 Sound Demixing Challenge 2023 中取得前三名成绩,在 MDX23 公开测试集上的平均 SDR 达到 9.41。

ABSTRACT

Music demixing is the task of separating different tracks from the given single audio signal into components, such as drums, bass, and vocals from the rest of the accompaniment. Separation of sources is useful for a range of areas, including entertainment and hearing aids. In this paper, we introduce two new benchmarks for the sound source separation tasks and compare popular models for sound demixing, as well as their ensembles, on these benchmarks. For the models' assessments, we provide the leaderboard at https://mvsep.com/quality_checker/, giving a comparison for a range of models. The new benchmark datasets are available for download. We also develop a novel approach for audio separation, based on the ensembling of different models that are suited best for the particular stem. The proposed solution was evaluated in the context of the Music Demixing Challenge 2023 and achieved top results in different tracks of the challenge. The code and the approach are open-sourced on GitHub.

研究动机与目标

  • 为解决现有基准(如 MUSDB18 和 Divide and Remaster)导致的过拟合问题,引入新的、独立的评估数据集。
  • 提供一个动态的、开放的排行榜,用于在多个基准上对比最先进模型与集成方法的性能。
  • 开发并验证一种基于模型集成的新型音频分离流程,该流程针对特定声乐茎干(声乐 vs. 乐器)进行定制化优化。
  • 通过结合声乐抑制、测试时增强与加权集成的混合方法,在 Sound Demixing Challenge 2023 中实现高性能表现。
  • 发布开源代码与模型,以促进音乐分离领域的可复现性与社区发展。

提出的方法

  • 作者提出了两个新基准:Synth MVSep(合成数据)与 Multisong MVSep(真实世界多轨录音),两者均旨在评估模型在现有数据集之外的泛化能力。
  • 动态排行榜托管于 https://mvsep.com/quality_checker/,研究人员可实时上传预测结果,对比模型性能。
  • 对于声乐分离,方法采用 UVR-MDX1 与 UVR-MDX2 模型,并结合基于波形反演的测试时增强技术,即对混合信号进行反向处理后重新推理,以提升模型鲁棒性。
  • 最终声乐输出通过加权平均获得:$\text{vocals} = \frac{\sum w_i \cdot \text{vocals}_i}{\sum w_i}$,其中最优权重分别为 12、8 和 3,对应 UVR-MDX1、UVR-MDX2 与 Demucs4。
  • 对于乐器茎干(贝斯、鼓、其他),方法应用四种不同的 Demucs4 与 Demucs3 变体,结合测试时增强与加权集成,并为每类茎干使用独立权重以优化性能。
  • 最终茎干估计通过乐器预测的线性组合重建:$\text{bass} = \frac{1}{3}(\text{instr} - \bar{\text{other}} - \bar{\text{drums}} + 2\cdot\bar{\text{bass}})$,鼓与其它类亦有类似表达式。

实验结果

研究问题

  • RQ1现有最先进模型在减少对 MUSDB18 和 Divide and Remaster 等流行数据集过拟合的新、独立基准上的表现如何?
  • RQ2一种按茎干类型(声乐 vs. 乐器)选择专用模型的模型集成策略,是否能优于单一模型基线?
  • RQ3通过波形反演实现的测试时增强,在多大程度上提升了分离模型的鲁棒性与泛化能力?
  • RQ4如何设计最优的加权方案以组合多个模型,从而在所有茎干上最大化 SDR?
  • RQ5一种结合声乐抑制、模型集成与测试时增强的统一开源流程,是否能在真实世界挑战(如 SDX2023)中实现顶尖性能?

主要发现

  • 所提出的集成方法在 MDX23 公开测试集上实现了 9.41 的平均 SDR,位列 Sound Demixing Challenge 2023 前三名。
  • 在 Multisong MVSep 基准上,集成方法实现了 10.11 的平均 SDR,各茎干 SDR 分别为:贝斯 12.68,鼓 11.68,其他 6.67,声乐 9.62。
  • MDX23 私有测试集的平均 SDR 为 9.25,证实了模型在未见数据上的强大泛化能力。
  • UVR-MDX1 与 UVR-MDX2 在声乐分离中表现最优,而带有 'demucs_ft' 与 'demucs_6s' 头部的 Demucs4 变体在乐器茎干中表现最佳。
  • 测试时波形反演增强显著提升了性能,尤其在声乐分离中,有效增强了模型对波形变化的鲁棒性。
  • 采用优化权重(声乐:12, 8, 3;贝斯:19, 4, 5, 8 等)的加权集成,在所有茎干与数据集上均实现了稳定性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。