Skip to main content
QUICK REVIEW

[논문 리뷰] A cappella: Audio-visual Singing Voice Separation

Juan F. Montesinos, Venkatesh S. Kadandale|arXiv (Cornell University)|2021. 04. 20.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 겹치는 음성 또는 낮은 음량의 목표 음성과 같은 도전적인 조건에서 분리 성능을 향상시키기 위해 얼굴 운동 특징을 활용하는 새로운 시각-청각 노래 음성 분리 방법인 A cappella를 소개한다. 스파티오템포럴 그래프 컨volution 네트워크를 통해 구현된 이 모델은 특히 두 명의 주요 음성과 낮은 목표 음량이 존재하는 가장 어려운 테스트 설정에서 음성 전용 U-Net 및 최신 시각-청각 음성 모델보다 뛰어난 성능을 보였다.

ABSTRACT

The task of isolating a target singing voice in music videos has useful applications. In this work, we explore the single-channel singing voice separation problem from a multimodal perspective, by jointly learning from audio and visual modalities. To do so, we present Acappella, a dataset spanning around 46 hours of a cappella solo singing videos sourced from YouTube. We also propose an audio-visual convolutional network based on graphs which achieves state-of-the-art singing voice separation results on our dataset and compare it against its audio-only counterpart, U-Net, and a state-of-the-art audio-visual speech separation model. We evaluate the models in the following challenging setups: i) presence of overlapping voices in the audio mixtures, ii) the target voice set to lower volume levels in the mix, and iii) combination of i) and ii). The third one being the most challenging evaluation setup. We demonstrate that our model outperforms the baseline models in the singing voice separation task in the most challenging evaluation setup. The code, the pre-trained models, and the dataset are publicly available at https://ipcv.github.io/Acappella/able at https://ipcv.github.io/Acappella/

연구 동기 및 목표

  • 겹치는 음성과 낮은 음량 조건에서 음성 전용 노래 음성 분리 모델의 한계를 해결하기 위해.
  • 노래하는 얼굴에서 유도된 시각적 신호—특히 얼굴 운동—이 소스 분리 성능 향상에 기여할 잠재력을 탐색하기 위해.
  • 이전에 공개된 바가 없었던 시각-청각 노래 음성 분리용 새로운 벤치마크 데이터셋을 구축하기 위해.
  • 청각 스펙트로그램과 얼굴 랜드마크에서 유도된 시각적 운동 특징을 융합하는 다중 모odal 딥 러닝 모델을 설계하고 평가하기 위해.
  • 특히 목표 음성 에너지가 낮거나 여러 음성이 겹칠 경우에 시각적 조건부 처리가 분리 성능에 미치는 영향을 입증하기 위해.

제안 방법

  • YouTube 기반의 단독 노래 영상 약 46시간 분량으로 구성된 새로운 데이터셋 A cappella를 제안하며, 오디오와 비디오가 동기화되어 있다.
  • MediaPipe를 사용해 영상 프레임에서 2차원 얼굴 랜드마크를 추출하고, 이를 스파티오템포럴 그래프 컨volution 네트워크(ST-GCN)로 처리하여 얼굴 운동의 역학을 모델링한다.
  • 시각적 운동 임베딩을 기반으로 U-Net 기반의 음성 분리 네트워크를 조건화하여 스펙트로그램 영역에서 소스 분리를 이끌어내도록 한다.
  • 복소수 스펙트로그램을 U-Net의 입력으로 사용하여, 노래 음성의 조화 및 시간적 구조를 더 잘 표현할 수 있도록 한다.
  • 일부 또는 두 명의 주요 음성 혼합물에 대해, 목표 음성의 음량 수준(α = 0.5, 1.0, 1.25, 2.0)을 다양하게 설정하여 모델을 엔드 투 엔드로 훈련한다.
  • 일인 및 이인 분리 시나리오에서의 성능를 균형 잡기 위해, 훈련 데이터에서 이인 혼합물의 비율에 대한 아블레이션 스터디를 수행한다.

실험 결과

연구 질문

  • RQ1얼굴 랜드마크에서 유도된 시각적 운동 특징이 음성 전용 모델의 노래 음성 분리 성능을 향상시킬 수 있는가? 특히 도전적인 조건에서 그러한 성능 향상이 이루어지는가?
  • RQ2목표 노래 음성이 겹치는 음성에 의해 가려지거나 음량이 낮을 경우, 시각 모odal이 성능에 어떤 영향을 미치는가?
  • RQ3일인 및 이인 분리 시나리오에서의 성능를 균형 잡기 위한 최적의 훈련 전략은 무엇인가?
  • RQ4제안된 시각-청각 모델은 노래 음성 환경에서 최신의 시각-청각 음성 분리 모델과 비교해 어떻게 성능가능한가?
  • RQ5목표 음성이 다른 소스와 스펙트럼적·시간적으로 유사할 경우, 시각적 운동 특징이 분리 성능에 얼마나 기여하는가?

주요 결과

  • 제안된 Y-Net-gr 모델은 가장 도전적인 테스트 설정—두 명의 주요 음성과 낮은 목표 음량(α = 0.5)에서 평균 SDR(7.27)와 SIR(17.6)를 기록하여 최고 성능을 달성했다.
  • 두 명의 주요 음성과 낮은 목표 음량 조건에서 Y-Net-gr는 음성 전용 U-Net(SDR: 2.07 vs. 1.29)과 시각-청각 음성 모델 LLCP(SDR: 2.07 vs. 1.76)를 모두 앞섰다.
  • 훈련 시 50%의 이인 혼합물이 포함된 모델은 일인 및 이인 테스트 성능 간의 최적의 균형을 이룩했으며, 평균 SDR 8.19와 SIR 17.21를 기록했다.
  • 시각적 조건부 처리가 낮은 음량 조건에서 성능 향상에 크게 기여함을 확인: Y-Net-gr는 α = 1.0일 때 일인 조건에서 SDR 11.08, 이인 조건에서 SDR 6.42를 기록했으며, 음성 전용 U-Net 및 LLCP를 모두 앞섰다.
  • 아블레이션 스터디 결과, 훈련에 이인 혼합물을 포함시키면 특히 낮은 음량의 목표에 대해 일반화 성능이 향상되며, 이는 일인 테스트 케이스에서도 마찬가지로 나타났다.
  • Y-Net-gr 모델은 모든 평가 설정에서 최신의 시각-청각 음성 분리 모델인 LLCP를 능가했으며, 특히 이인·낮은 음량 케이스에서 노래 전용 시각 모델링의 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.