Skip to main content
QUICK REVIEW

[论文解读] CWS-PResUNet: Music Source Separation with Channel-wise Subband Phase-aware ResUNet

Haohe Liu, Qiuqiang Kong|arXiv (Cornell University)|Dec 9, 2021
Speech and Audio Processing被引用 13
一句话总结

该论文提出CWS-PResUNet,一种新颖的音乐源分离模型,通过使用通道级子带(CWS)特征和复数理想比掩码(cIRM)估计,提升了人声分离的性能。通过解耦幅度与相位估计并减少全局权重共享,该模型在MUSDB18HQ测试集上实现了人声分离的最先进SDR值8.92,优于先前的方法,包括Demucs和X-UMX。

ABSTRACT

Music source separation (MSS) shows active progress with deep learning models in recent years. Many MSS models perform separations on spectrograms by estimating bounded ratio masks and reusing the phases of the mixture. When using convolutional neural networks (CNN), weights are usually shared within a spectrogram during convolution regardless of the different patterns between frequency bands. In this study, we propose a new MSS model, channel-wise subband phase-aware ResUNet (CWS-PResUNet), to decompose signals into subbands and estimate an unbound complex ideal ratio mask (cIRM) for each source. CWS-PResUNet utilizes a channel-wise subband (CWS) feature to limit unnecessary global weights sharing on the spectrogram and reduce computational resource consumptions. The saved computational cost and memory can in turn allow for a larger architecture. On the MUSDB18HQ test set, we propose a 276-layer CWS-PResUNet and achieve state-of-the-art (SoTA) performance on vocals with an 8.92 signal-to-distortion ratio (SDR) score. By combining CWS-PResUNet and Demucs, our ByteMSS system ranks the 2nd on vocals score and 5th on average score in the 2021 ISMIR Music Demixing (MDX) Challenge limited training data track (leaderboard A). Our code and pre-trained models are publicly available at: https://github.com/haoheliu/2021-ISMIR-MSS-Challenge-CWS-PResUNet

研究动机与目标

  • 解决传统基于频谱图的模型在频带间全局共享权重所带来的局限性。
  • 通过利用通道级子带特征,降低计算成本并提升频率分辨率,从而改善源分离性能。
  • 通过联合预测幅度和相位变化,实现无界复数理想比掩码(cIRM)估计。
  • 在2021年ISMIR MDX挑战赛中,实现音乐源分离的最先进性能,尤其在人声分离方面。

提出的方法

  • 该模型采用通道级子带(CWS)特征提取方法,通过均匀滤波器组将输入信号分解为4个子带,降低频率维度并增加通道数量。
  • CWS频谱图由一个相位感知的ResUNet处理,输出四个预测:幅度掩码、相位变化的实部与虚部,以及直接的幅度预测。
  • 复数频谱图通过如下公式重构:$\hat{S}^\prime = \text{relu}(|X^\prime| \odot \text{sigmoid}(\hat{M}) + \hat{Q}) \exp^{j(\angle X^\prime + \angle\hat{\theta})}$,其中$\angle\hat{\theta}$由$\hat{P}_r$和$\hat{P}_i$推导得出。
  • 通过显式估计相位变化,避免了相位复用,从而实现无界cIRM估计,提升重建保真度。
  • 通过合成滤波器对子带进行重建,从子带输出恢复最终的源信号。
  • 由于CWS输入带来的计算成本降低,该架构支持更深的网络(如276层模型),在不增加资源使用的情况下实现更高容量。

实验结果

研究问题

  • RQ1与全带频谱图相比,通道级子带特征是否能提升音乐源分离模型的效率与性能?
  • RQ2通过学习的相位变化分量显式估计相位,是否能优于相位复用,从而获得更好的分离性能?
  • RQ3由于CWS特征带来的计算成本降低,是否能有效训练更深的ResUNet架构?
  • RQ4与受限掩码估计相比,所提出的cIRM估计策略在SDR和主观质量方面表现如何?
  • RQ5将CWS-PResUNet与时间域模型(如Demucs)结合,是否能进一步提升整体分离性能?

主要发现

  • CWS-PResUNet在MUSDB18HQ测试集的人声轨道上实现了最先进信号失真比(SDR)8.92。
  • 该模型在人声和其他源上均优于基线模型(包括X-UMX、D3Net和Demucs),在其他源上的SDR达到5.84。
  • ByteMSS系统(结合CWS-PResUNet与Demucs)在2021年ISMIR MDX挑战赛(有限训练数据赛道)中,人声排名第二,平均SDR排名第五。
  • 使用设计的滤波器组进行子带重建,重建误差可忽略不计,且随着子带数量增加(2、4、8子带),误差呈上升趋势。
  • 该模型表明,CWS特征可降低计算成本与内存使用,使更大架构的实现成为可能而不牺牲效率。
  • CWS-PResUNet与时间域模型(如Demucs)在贝斯和军鼓上的性能差距表明,时间域建模在打击乐和带限源上可能更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。