Skip to main content
QUICK REVIEW

[论文解读] A cappella: Audio-visual Singing Voice Separation

Juan F. Montesinos, Venkatesh S. Kadandale|arXiv (Cornell University)|Apr 20, 2021
Speech and Audio Processing被引用 4
一句话总结

本文提出 A cappella,一种新型音视频歌唱声源分离方法,通过时空图卷积网络利用面部运动特征,在重叠人声或目标音量较低等挑战性条件下提升分离性能。所提出的 Y-Net-gr 模型在仅使用音频的 U-Net 及当前最先进音视频语音模型中表现更优,尤其在双主唱且目标音量较低的最困难测试设置中表现突出。

ABSTRACT

The task of isolating a target singing voice in music videos has useful applications. In this work, we explore the single-channel singing voice separation problem from a multimodal perspective, by jointly learning from audio and visual modalities. To do so, we present Acappella, a dataset spanning around 46 hours of a cappella solo singing videos sourced from YouTube. We also propose an audio-visual convolutional network based on graphs which achieves state-of-the-art singing voice separation results on our dataset and compare it against its audio-only counterpart, U-Net, and a state-of-the-art audio-visual speech separation model. We evaluate the models in the following challenging setups: i) presence of overlapping voices in the audio mixtures, ii) the target voice set to lower volume levels in the mix, and iii) combination of i) and ii). The third one being the most challenging evaluation setup. We demonstrate that our model outperforms the baseline models in the singing voice separation task in the most challenging evaluation setup. The code, the pre-trained models, and the dataset are publicly available at https://ipcv.github.io/Acappella/able at https://ipcv.github.io/Acappella/

研究动机与目标

  • 解决仅使用音频的歌唱声源分离模型在人声重叠与低音量场景下的局限性。
  • 探索来自歌唱人脸的视觉线索——特别是面部运动——在提升声源分离性能方面的潜力。
  • 构建首个公开的音视频歌唱声源分离基准数据集,此前尚无此类公开数据集。
  • 设计并评估一种融合音频频谱图与人脸关键点视觉运动特征的多模态深度学习模型。
  • 在挑战性分离设置中证明视觉条件的优越性,特别是在目标语音能量较低或多人声重叠时。

提出的方法

  • 提出新数据集 A cappella,包含约 46 小时基于 YouTube 的无伴奏独唱视频,音频与视频同步。
  • 使用 MediaPipe 从视频帧中提取 2D 人脸关键点,并通过时空图卷积网络(ST-GCN)处理,以建模面部运动动态。
  • 将基于 U-Net 的音频分离网络以视觉运动嵌入为条件,以在频谱域中引导声源分离。
  • 使用复数频谱图作为 U-Net 的输入,以更好地表征歌唱声源中的谐波与时间结构。
  • 在包含一个或两个主唱的混合音频上端到端训练模型,目标语音音量水平变化多样(α = 0.5, 1.0, 1.25, 2.0)。
  • 对训练中双主唱混合比例进行消融研究,以优化在单主唱与双主唱测试场景下的综合性能。

实验结果

研究问题

  • RQ1来自人脸关键点的视觉运动特征是否能提升仅使用音频模型在挑战性条件下的歌唱声源分离性能,尤其是在复杂场景中?
  • RQ2当目标歌唱语音被重叠人声遮蔽或音量较低时,引入视觉模态对性能有何影响?
  • RQ3在单主唱与双主唱分离场景之间平衡性能的最优训练策略是什么?
  • RQ4在歌唱语音场景中,所提出的音视频模型与当前最先进音视频语音分离模型相比表现如何?
  • RQ5当目标语音在频谱与时间特性上与其他声源相似时,视觉运动特征在多大程度上增强分离效果?

主要发现

  • 所提出的 Y-Net-gr 模型在最困难的测试设置中达到最高平均 SDR(7.27)与 SIR(17.6),即双主唱且目标音量较低(α = 0.5)的情况。
  • 在双主唱且目标音量较低的设置中,Y-Net-gr 显著优于仅使用音频的 U-Net(SDR:2.07 vs. 1.29)与音视频语音模型 LLCP(SDR:2.07 vs. 1.76)。
  • 在训练中使用 50% 双主唱混合数据的模型在单主唱与双主唱测试性能之间达到最佳平衡,平均 SDR 为 8.19,SIR 为 17.21。
  • 视觉条件在低音量场景中显著提升性能:Y-Net-gr 在 α = 1.0 时(单主唱)达到 SDR 11.08,在 α = 1.0 时(双主唱)达到 SDR 6.42,优于仅使用音频的 U-Net 与 LLCP。
  • 消融研究证实,将双主唱混合数据纳入训练可提升泛化能力,尤其在低音量目标情况下,即使在单主唱测试场景中亦然。
  • Y-Net-gr 模型在所有评估设置中均优于当前最先进音视频语音分离模型 LLCP,尤其在双主唱、低音量场景中表现更优,证明了面向歌唱语音的视觉建模优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。