Skip to main content
QUICK REVIEW

[论文解读] Voice and accompaniment separation in music using self-attention convolutional neural network

Yuzhou Liu, Balaji Thoshkahna|arXiv (Cornell University)|Mar 19, 2020
Speech and Audio Processing参考文献 16被引用 19
一句话总结

本文提出一种自注意力密集-UNet(Self-Attention Dense-UNet)神经网络,用于音乐中的语音与伴奏分离,通过在密集连接的UNet架构中引入自注意力子网络,以建模长期音乐重复。该方法在基线模型上实现了语音分离SDR 19.5%的相对提升,优于MMDenseLSTM和MMDenseNet等最先进模型。

ABSTRACT

Music source separation has been a popular topic in signal processing for decades, not only because of its technical difficulty, but also due to its importance to many commercial applications, such as automatic karoake and remixing. In this work, we propose a novel self-attention network to separate voice and accompaniment in music. First, a convolutional neural network (CNN) with densely-connected CNN blocks is built as our base network. We then insert self-attention subnets at different levels of the base CNN to make use of the long-term intra-dependency of music, i.e., repetition. Within self-attention subnets, repetitions of the same musical patterns inform reconstruction of other repetitions, for better source separation performance. Results show the proposed method leads to 19.5% relative improvement in vocals separation in terms of SDR. We compare our methods with state-of-the-art systems i.e. MMDenseNet and MMDenseLSTM.

研究动机与目标

  • 通过深度学习提升音乐中语音与伴奏的分离性能,尤其是在缺乏干净源录音的情况下。
  • 解决建模音乐中长期时间依赖性和重复的挑战,这对准确的源分离至关重要。
  • 通过将自注意力机制整合到密集卷积架构中,超越MMDenseNet和MMDenseLSTM等现有最先进模型的性能。
  • 证明自注意力子网络能有效捕捉音乐中的重复内模式,从而提升重建质量。

提出的方法

  • 使用Dense-UNet架构作为基础模型,将标准卷积层替换为密集连接的CNN模块(DenseNet),以改善特征复用并减少梯度消失。
  • 在网络多个层级插入自注意力子网,以建模音乐时频表示中的长程依赖性和重复。
  • 自注意力机制从特征图计算查询、键和值,通过softmax归一化的点积注意力机制,关注时间与频率维度上的相关模式。
  • 模型以混合信号的幅度STFT作为输入,通过1×1卷积层预测软掩码,再与输入逐元素相乘以重建源信号。
  • 损失函数为掩码输出与真实幅度STFT之间的L1范数,使用ADAM优化器,初始初始学习率为5e-5进行优化。
  • 推理阶段采用1250帧的重叠窗口,重叠率为3/4,结果取平均以提升鲁棒性。

实验结果

研究问题

  • RQ1自注意力机制能否有效建模音乐中的长期重复,从而提升语音与伴奏分离性能?
  • RQ2将自注意力机制集成到Dense-UNet架构中,与标准CNN和RNN模型相比,性能有何变化?
  • RQ3所提方法在多大程度上缩小了与理想幅度STFT性能的差距?
  • RQ4考虑到语音分离中更大的频谱掩蔽挑战,自注意力机制是否对语音分离的提升大于对伴奏分离的提升?

主要发现

  • 所提出的自注意力密集-UNet在语音分离SDR上相比无注意力的密集-UNet基线模型实现了19.5%的相对提升。
  • 与基线相比,模型在语音分离上绝对SDR提升1.5 dB,伴奏分离提升1.19 dB,相对增益分别为22.8%和9.2%。
  • 在公开测试集上,模型在伴奏分离上达到13.90 dB的SDR,在语音分离上达到7.72 dB,优于MMDenseNet(12.10 dB和6.00 dB)和MMDenseLSTM(12.73 dB和6.31 dB)。
  • 与MMDenseLSTM相比,模型在伴奏分离上相对SDR增益提升14.9%,在语音分离上提升28.7%,表明在语音分离方面具有显著优势。
  • 所提模型与理想幅度STFT之间的差距仅在2–3 dB之间,所有指标均接近理论极限,表明性能极高。
  • 在MMDenseLSTM中增加BLSTM层仅带来与MMDenseNet相比的微小改进,表明RNN在该任务中不如所提出的自注意力机制有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。