Skip to main content
QUICK REVIEW

[논문 리뷰] Voice and accompaniment separation in music using self-attention convolutional neural network

Yuzhou Liu, Balaji Thoshkahna|arXiv (Cornell University)|2020. 03. 19.
Speech and Audio Processing참고 문헌 16인용 수 19
한 줄 요약

이 논문은 음악에서 음성과 반주 분리에 대해 자기주의 컨볼루션 신경망(Self-Attention Dense-UNet)을 제안하며, 장기적인 음악 반복을 모델링하기 위해 자기주의 서브넷을 조밀하게 연결된 UNet 아키텍처에 통합한다. 이 방법은 기준 모델 대비 음성 분리 SDR에서 19.5%의 상대적 향상을 달성하여 MMDenseLSTM 및 MMDenseNet과 같은 최신 기술 모델을 능가한다.

ABSTRACT

Music source separation has been a popular topic in signal processing for decades, not only because of its technical difficulty, but also due to its importance to many commercial applications, such as automatic karoake and remixing. In this work, we propose a novel self-attention network to separate voice and accompaniment in music. First, a convolutional neural network (CNN) with densely-connected CNN blocks is built as our base network. We then insert self-attention subnets at different levels of the base CNN to make use of the long-term intra-dependency of music, i.e., repetition. Within self-attention subnets, repetitions of the same musical patterns inform reconstruction of other repetitions, for better source separation performance. Results show the proposed method leads to 19.5% relative improvement in vocals separation in terms of SDR. We compare our methods with state-of-the-art systems i.e. MMDenseNet and MMDenseLSTM.

연구 동기 및 목표

  • 청결한 소스 레코딩이 없는 상황에서도 딥러닝을 활용해 음성과 반주 분리를 향상시키는 것.
  • 정확한 소스 분리를 위해 필수적인 장기적인 시간적 의존성과 반복을 모델링하는 과제를 해결하는 것.
  • 자기주의 메커니즘을 조밀한 컨볼루션 아키텍처에 통합하여 MMDenseNet 및 MMDenseLSTM과 같은 기존 최신 기술 모델을 초월하는 성능 향상을 이루는 것.
  • 자기주의 서브넷이 음악 내부의 반복 패턴을 효과적으로 포착하여 재구성 품질을 향상시킨다는 것을 입증하는 것.

제안 방법

  • 기본 모델로 조밀하게 연결된 UNet 아키텍처를 사용하며, 표준 컨볼루션 레이어를 조밀하게 연결된 CNN 블록(DenseNet)으로 대체하여 특징 재사용을 향상시키고 기울기 소실을 줄인다.
  • 신경망의 다수의 수준에 자기주의 서브넷을 삽입하여 음악의 시간-주파수 표현에서 장거리 의존성과 반복을 모델링한다.
  • 자기주의 메커니즘은 특징 맵에서 쿼리, 키, 밸류를 계산하며, 소프트맥스 정규화된 내적 곱을 사용해 시간과 주파수 전반에서 관련 패턴에 주의를 기울인다.
  • 모델은 혼합 신호의 크기 STFT를 입력으로 사용하며, 1×1 컨볼루션 레이어를 통해 소프트 마스크를 예측하고, 이를 입력과 요소별 곱셈으로 수행해 소스 신호를 재구성한다.
  • 손실 함수는 마스크 출력과 진짜 값인 크기 STFT 간의 L1 노름이며, 초기 학습률 5e-5로 ADAM 옵timizer를 사용해 최적화된다.
  • 추론 과정에서는 1250 프레임의 겹치는 윈도우를 사용하며, 3/4 겹침을 적용하고 결과를 평균내어 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1자기주의 메커니즘이 음악의 장기적인 반복을 효과적으로 모델링하여 음성과 반주 분리 성능을 향상시킬 수 있는가?
  • RQ2Dense-UNet 아키텍처에 자기주의를 통합할 경우, 표준 CNN 및 RNN 기반 모델 대비 성능에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 오라클 크기 STFT 성능과의 격차를 어느 정도 줄이는가?
  • RQ4스펙트럼 마스킹 문제에 더 큰 도전이 있는 음성에 비해 반주에 비해 자기주의 추가가 더 큰 향상을 가져오는가?

주요 결과

  • 제안된 자기주의 Dense-UNet은 자기주의가 없는 Dense-UNet 기준 모델 대비 음성 분리 SDR에서 19.5%의 상대적 향상을 달성한다.
  • 모델은 음성에 대해 절대 SDR를 1.5 dB 향상시키고 반주에 대해 1.19 dB 향상시켜, 각각 상대적 향상률이 22.8%와 9.2%이다.
  • 공개 테스트 세트에서 모델은 반주에 대해 13.90 dB, 음성에 대해 7.72 dB의 SDR를 기록했으며, MMDenseNet(12.10 dB 및 6.00 dB)과 MMDenseLSTM(12.73 dB 및 6.31 dB)을 모두 능가한다.
  • MMDenseLSTM 대비 반주에 대해 14.9%의 상대적 SDR 향상과 음성에 대해 28.7%의 상대적 SDR 향상을 기록하여, 특히 음성 분리에서 뚜렷한 우월성을 입증한다.
  • 제안된 모델과 오라클 크기 STFT 간의 격차는 모든 지표에서 단지 2–3 dB이며, 이는 이론적 한계에 매우 가까운 높은 성능을 의미한다.
  • MMDenseLSTM에 BLSTM 레이어를 추가해도 MMDenseNet 대비 거의 향상되지 않아, 이 작업에 대해 RNN이 제안된 자기주의 메커니즘보다 덜 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.