Skip to main content
QUICK REVIEW

[论文解读] Denoising Auto-encoder with Recurrent Skip Connections and Residual Regression for Music Source Separation

Jen-Yu Liu, Yi‐Hsuan Yang|arXiv (Cornell University)|Jul 5, 2018
Speech and Audio Processing参考文献 6被引用 8
一句话总结

本文提出ARC,一种结合一维卷积、循环跳跃连接和残差回归的去噪自编码器,用于音乐源分离。通过沿时间轴应用一维卷积,模型能够在中间特征上应用循环层,从而改善时间建模;通过残差回归,其在MUSDB18测试集上对人声的SDR达到5.74,优于基线模型。

ABSTRACT

Convolutional neural networks with skip connections have shown good performance in music source separation. In this work, we propose a denoising Auto-encoder with Recurrent skip Connections (ARC). We use 1D convolution along the temporal axis of the time-frequency feature map in all layers of the fully-convolutional network. The use of 1D convolution makes it possible to apply recurrent layers to the intermediate outputs of the convolution layers. In addition, we also propose an enhancement network and a residual regression method to further improve the separation result. The recurrent skip connections, the enhancement module, and the residual regression all improve the separation quality. The ARC model with residual regression achieves 5.74 siganl-to-distoration ratio (SDR) in vocals with MUSDB in SiSEC 2018. We also evaluate the ARC model alone on the older dataset DSD100 (used in SiSEC 2016) and it achieves 5.91 SDR in vocals.

研究动机与目标

  • 通过在全卷积网络中对时间特征应用循环建模,提升音乐源分离性能。
  • 通过专用增强模块减少分离音频中的残留噪声和伪影,尤其在人声方面。
  • 通过学习残差的残差回归方法,迭代优化估计,提升分离性能。
  • 在MUSDB18和DSD100数据集上评估模型,以评估泛化能力和竞争性能。
  • 探索架构选择,如权重归一化、循环层位置和跳跃连接设计,以实现最佳性能。

提出的方法

  • 核心模型ARC沿时间轴使用一维卷积,以保留序列结构,从而可直接在特征图上应用循环层。
  • 通过门控循环单元(GRUs)在跳跃连接特征上实现循环跳跃连接,增强长程时间依赖性。
  • 增强模块作为固定分离模型权重的去噪自编码器进行训练,用于推理后优化输出,减少微小伪影。
  • 残差回归通过迭代应用分离模型实现:每次输出为前次估计与模型预测残差之和。
  • 使用权重归一化而非批量归一化,以提升主观音频质量,尽管客观性能略有损失。
  • 模型处理对数幅度谱图,输入为log(1 + 混合谱图),目标为log(1 + 源谱图)。

实验结果

研究问题

  • RQ1与标准跳跃连接相比,将循环层应用于跳跃连接特征是否能提升音乐源分离性能?
  • RQ2通过专用增强模块进行后处理是否能减少分离人声中的感知伪影?
  • RQ3通过残差学习迭代优化估计,残差回归是否能提升分离质量?
  • RQ4沿时间轴的一维卷积如何相比二维卷积更好地实现循环网络的集成?
  • RQ5归一化技术(权重归一化与批量归一化)对客观SDR和主观音频质量有何影响?

主要发现

  • ARC模型结合残差回归在MUSDB18数据集人声上达到5.74的SDR,表明其在非集成模型中处于最先进水平。
  • 在DSD100数据集上,ARC模型单独实现人声5.91的SDR,仅次于MMDenseNet和MMDenseLSTM模型,排名第二。
  • 将循环层应用于跳跃连接特征的配置性能最佳,优于在转置卷积层后或编码器路径中放置循环层的方案。
  • 权重归一化产生的音频主观上比批量归一化更少噪声,尽管批量归一化在多数源上客观SDR得分略高。
  • 增强模块和残差回归均对分离性能有提升,其中残差回归在人声清晰度提升和伪影减少方面表现显著。
  • 谱图对比显示,估计输出在谐波结构上与真实值匹配,但仍不够锐利且更嘈杂,表明未来仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。