Skip to main content
QUICK REVIEW

[论文解读] Decoupling Magnitude and Phase Estimation with Deep ResUNet for Music Source Separation

Qiuqiang Kong, Yin Cao|arXiv (Cornell University)|Sep 12, 2021
Speech and Audio Processing被引用 38
一句话总结

本文将复数理想比掩码(cIRMs)中的幅值与相位解耦,通过与直接幅度预测相结合实现无界掩码幅值,并引入143层残差UNet(ResUNet)以在MUSDB18上实现最先进的音乐源分离,尤其是人声(SDR 8.98 dB)。

ABSTRACT

Deep neural network based methods have been successfully applied to music source separation. They typically learn a mapping from a mixture spectrogram to a set of source spectrograms, all with magnitudes only. This approach has several limitations: 1) its incorrect phase reconstruction degrades the performance, 2) it limits the magnitude of masks between 0 and 1 while we observe that 22% of time-frequency bins have ideal ratio mask values of over~1 in a popular dataset, MUSDB18, 3) its potential on very deep architectures is under-explored. Our proposed system is designed to overcome these. First, we propose to estimate phases by estimating complex ideal ratio masks (cIRMs) where we decouple the estimation of cIRMs into magnitude and phase estimations. Second, we extend the separation method to effectively allow the magnitude of the mask to be larger than 1. Finally, we propose a residual UNet architecture with up to 143 layers. Our proposed system achieves a state-of-the-art MSS result on the MUSDB18 dataset, especially, a SDR of 8.98~dB on vocals, outperforming the previous best performance of 7.24~dB. The source code is available at: https://github.com/bytedance/music_source_separation

研究动机与目标

  • 通过解决相位估计的局限性和幅度掩码界限来推动MSS的改进。
  • 提出用于复杂掩码(cIRMs)的幅值和相位解耦估计。
  • 通过将有界掩码与直接幅度预测相结合,使掩码幅值大于1成为可能。
  • 引入非常深的残差UNet(143层)以提升MSS性能。
  • 在MUSDB18上展示最先进的结果,尤其是人声。

提出的方法

  • 通过预测有界幅度掩码并给出实部/虚部分量来解耦cIRM估计,以导出掩码相位的余弦与正弦。
  • 利用M_mag、cos(angle M)、sin(angle M)和X计算cIRM,以通过S = M X在幅值缩放和相位旋转下恢复S。
  • 通过将有界掩码与直接幅度预测项相结合,估计源幅度 |S| = ReLU(M_mag ⊙ |X| + Q)。
  • 通过共享骨干网预测四个输出:M_mag、Q、P_r、P_i;应用适当激活并构造复掩码M = M_r + j M_i来实现分离。
  • 开发一个143层的残差UNet(ResUNet),包含残差编码器块、残差解码器块和中间卷积块,以实现适用于MSS的深层架构。

实验结果

研究问题

  • RQ1解耦幅值和相位是否能提升基于复数掩码的MSS相对于传统基于幅值的方法?
  • RQ2允许掩码幅值>1如何影响MSS性能和上界?
  • RQ3非常深的残差UNet是否在MSS上比较浅的架构带来实际收益?
  • RQ4将有界掩码估计与直接幅度预测相结合是否比任一方法单独使用更能提升SDR?
  • RQ5在应用这些技术时,MUSDB18上人声与乐器源的性能提升如何?

主要发现

  • 提出的解耦cIRM估计相较于无相位/只幅度的方法提高了性能,提升了人声的SDR。
  • 通过cIRM实现幅值大于1的无界掩码可获得更高的理论上限和实际SDR增益。
  • 将有界掩码与直接幅度预测项结合,提升了MSS性能,优于单独使用任一机制。
  • 一个143层的残差UNet(ResUNet)显著优于更浅的UNet,证实深层架构有利于MSS。
  • 在MUSDB18上,最终的ResUNetDecouple+系统在人声上达到8.98 dB SDR,超过之前的最好(7.24 dB)及其他基线;其他源也有改进(例如低音6.04 dB,鼓6.62 dB,其他5.29 dB,伴奏16.63 dB)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。