Skip to main content
QUICK REVIEW

[论文解读] Improving DNN-based Music Source Separation using Phase Features

Joachim Muth, Stefan Uhlich|arXiv (Cornell University)|Jul 7, 2018
Speech and Audio Processing参考文献 13被引用 12
一句话总结

本文提出了一种新颖的深度神经网络(DNN)架构,通过联合利用短时傅里叶变换(STFT)中的幅度和相位特征,提升了音乐源分离性能。通过将STFT相位的时间和频率导数(而非原始相位)作为输入特征,并采用分别处理幅度和相位的双分支网络结构,该方法在DSD100数据集上实现了低音音色6.17%的信噪比失真比(SDR)相对提升,且在所有乐器上均表现出一致的性能增益。

ABSTRACT

Music source separation with deep neural networks typically relies only on amplitude features. In this paper we show that additional phase features can improve the separation performance. Using the theoretical relationship between STFT phase and amplitude, we conjecture that derivatives of the phase are a good feature representation opposed to the raw phase. We verify this conjecture experimentally and propose a new DNN architecture which combines amplitude and phase. This joint approach achieves a better signal-to distortion ratio on the DSD100 dataset for all instruments compared to a network that uses only amplitude features. Especially, the bass instrument benefits from the phase information.

研究动机与目标

  • 探究STFT中的相位信息是否能在基于深度学习的音乐源分离中超越仅使用幅度的模型。
  • 识别能有效提升DNN性能的相位表示形式,超越原始相位输入。
  • 设计一种能有效融合幅度和相位特征且不偏向幅度的神经网络架构。
  • 在DSD100基准数据集上验证所提方法,并量化不同乐器上的性能增益。

提出的方法

  • 作者采用STFT相位的时间导数(即瞬时频率)和频率导数(即群延迟)作为相位特征,其理论基础是相位与幅度之间的理论关联。
  • 预处理步骤校正了离散STFT引入的系统性相位偏移,提升了特征的一致性与网络学习效率。
  • 提出一种双分支DNN架构:一个分支处理幅度特征,另一个分支处理预处理后的相位导数特征,两个分支均采用两层全连接层,每层500个神经元。
  • 将两个分支的输出拼接后,通过一个带有ReLU激活函数的最终全连接层,预测目标乐器的幅度。
  • 在训练过程中,按每个频率 bins 的批量均值和标准差进行特征归一化,同时保留五帧的时间上下文。
  • 网络采用均方误差损失端到端训练,利用逆STFT从估计的幅度和混合信号的相位重建时域信号。

实验结果

研究问题

  • RQ1STFT中的相位特征是否能超越仅使用幅度的模型,提升基于DNN的音乐源分离性能?
  • RQ2原始STFT相位是否适合作为DNN的输入,还是导出的相位表示形式(如导数)能带来更好的性能?
  • RQ3如何在DNN中有效结合幅度和相位特征,以避免幅度主导并确保相位信息产生有意义的贡献?
  • RQ4校正离散STFT引起的相位偏移对模型性能有何影响?
  • RQ5所提方法是否在DSD100基准数据集上对不同乐器实现了可测量的信噪比失真比(SDR)提升?

主要发现

  • 与常因学习效率低下而被忽略的原始相位输入相比,使用STFT相位的时间和频率导数作为特征,显著提升了DNN性能。
  • 所提出的双分支网络架构成功融合了幅度和相位特征,防止网络忽略相位信息。
  • 校正离散STFT引起的相位偏移,使相位表示更加一致且易于学习,从而提升了模型性能。
  • 在DSD100测试集上,所提方法在低音音色上实现了0.2 dB的SDR提升(3.44 dB vs. 3.24 dB),相对于仅使用幅度的基线模型实现了6.17%的相对提升。
  • 所有乐器均表现出可测量的SDR增益:军鼓+0.03 dB(+0.64%),其他乐器+0.11 dB(+3.11%),人声+0.04 dB(+0.84%),表明整体性能一致提升。
  • 主观听觉评估确认,改进的分离效果使乐器分离更清晰、更分明,尤其在低音音色上表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。