Skip to main content
QUICK REVIEW

[논문 리뷰] CWS-PResUNet: Music Source Separation with Channel-wise Subband Phase-aware ResUNet

Haohe Liu, Qiuqiang Kong|arXiv (Cornell University)|2021. 12. 09.
Speech and Audio Processing인용 수 13
한 줄 요약

이 논문은 채널별 밴드(Channnel-wise Subband, CWS) 특징과 복소 이상 비율 마스크(Complex Ideal Ratio Mask, cIRM) 추정을 활용하여 보컬 분리 성능을 향상시키는 새로운 음악 소스 분리 모델인 CWS-PResUNet을 제안한다. 진폭과 위상 추정을 분리하고 전역 가중치 공유를 줄임으로써 MUSDB18HQ 테스트 세트에서 보컬에 대해 SOTA 수준의 SDR 8.92를 달성하며, Demucs 및 X-UMX와 같은 이전 방법들을 능가한다.

ABSTRACT

Music source separation (MSS) shows active progress with deep learning models in recent years. Many MSS models perform separations on spectrograms by estimating bounded ratio masks and reusing the phases of the mixture. When using convolutional neural networks (CNN), weights are usually shared within a spectrogram during convolution regardless of the different patterns between frequency bands. In this study, we propose a new MSS model, channel-wise subband phase-aware ResUNet (CWS-PResUNet), to decompose signals into subbands and estimate an unbound complex ideal ratio mask (cIRM) for each source. CWS-PResUNet utilizes a channel-wise subband (CWS) feature to limit unnecessary global weights sharing on the spectrogram and reduce computational resource consumptions. The saved computational cost and memory can in turn allow for a larger architecture. On the MUSDB18HQ test set, we propose a 276-layer CWS-PResUNet and achieve state-of-the-art (SoTA) performance on vocals with an 8.92 signal-to-distortion ratio (SDR) score. By combining CWS-PResUNet and Demucs, our ByteMSS system ranks the 2nd on vocals score and 5th on average score in the 2021 ISMIR Music Demixing (MDX) Challenge limited training data track (leaderboard A). Our code and pre-trained models are publicly available at: https://github.com/haoheliu/2021-ISMIR-MSS-Challenge-CWS-PResUNet

연구 동기 및 목표

  • 주파수 대역 전반에 걸쳐 전역적으로 가중치를 공유하는 전통적인 스펙트로그램 기반 모델의 한계를 해결하기 위해.
  • 채널별 밴드 특징을 활용하여 계산 비용을 줄이고 주파수 해상도를 향상시켜 소스 분리 성능을 향상시키기 위해.
  • 동시에 진폭과 위상 변동을 예측함으로써 무한정 복소 이상 비율 마스크(cIRM) 추정을 가능하게 하기 위해.
  • 2021 ISMIR MDX 챌린지에서 특히 보컬에 대해 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 입력 신호를 균일한 필터 백터를 사용해 4개의 밴드로 분해함으로써 주파수 차원을 감소시키고 채널 수를 증가시키는 채널별 밴드(CWS) 특징 추출 방법을 사용한다.
  • CWS 스펙트로그램은 위상 인식 ResUNet에 의해 처리되며, 네 가지 출력을 추정한다: 진폭 마스크, 위상 변동의 실수 및 허수 성분, 직접적인 진폭 예측.
  • 복소 스펙트로그램은 다음 공식을 통해 재구성된다: $\hat{S}^\prime = \text{relu}(|X^\prime| \odot \text{sigmoid}(\hat{M}) + \hat{Q}) \exp^{j(\angle X^\prime + \angle\hat{\theta})}$, 여기서 $\angle\hat{\theta}$ 는 $\hat{P}_r$ 와 $\hat{P}_i$ 에서 유도된다.
  • 위상 재사용을 피하기 위해 위상 변동을 명시적으로 추정함으로써 무한정 cIRM 추정이 가능해지고 재구성 정밀도가 향상된다.
  • 서브밴드 재구성은 복구된 서브밴드 출력에서 최종 소스 신호를 복원하기 위해 합성 필터를 사용하여 수행된다.
  • CWS 입력으로 인한 계산 비용 감소 덕분에 더 깊은 네트워크(예: 276층 모델)가 가능해져 자원 사용량을 늘리지 않으면서도 높은 용량을 구현할 수 있다.

실험 결과

연구 질문

  • RQ1전체 대역 스펙트로그램에 비해 채널별 서브밴드 특징이 음악 소스 분리 모델의 효율성과 성능을 향상시키는가?
  • RQ2학습된 위상 변동 성분을 통한 명시적 위상 추정이 위상 재사용에 비해 더 나은 분리 성능을 낼 수 있는가?
  • RQ3CWS 특징 덕분에 계산 비용이 감소함으로써 더 깊은 ResUNet 아키텍처를 효과적으로 훈련시킬 수 있는가?
  • RQ4제안된 cIRM 추정 전략은 경계 마스크 추정에 비해 SDR와 청각적 품질 측면에서 어떻게 비교되는가?
  • RQ5Demucs와 같은 타임도메인 모델과 CWS-PResUNet을 통합하면 전체 분리 성능이 더욱 향상되는가?

주요 결과

  • CWS-PResUNet는 MUSDB18HQ 테스트 세트의 보컬 트랙에서 최신 기술 수준의 신호 대 간섭비(SDR) 8.92를 달성한다.
  • 모델은 X-UMX, D3Net, Demucs를 포함한 베이스라인 모델보다 보컬과 기타 소스에서 모두 뛰어난 성능을 보이며, 기타 소스에 대해 SDR 5.84를 기록한다.
  • CWS-PResUNet와 Demucs를 통합한 ByteMSS 시스템은 2021 ISMIR MDX 챌린지에서 보컬 부문 2위, 평균 SDR 기준 5위를 기록했다(제한된 훈련 데이터 트랙).
  • 설계된 필터 백터를 사용한 서브밴드 재구성은 재구성 오차가 극히 미미하며, 서브밴드 수가 증가함에 따라 오차가 증가하는 경향을 보였다(2, 4, 8 서브밴드).
  • 모델은 CWS 특징이 계산 비용과 메모리 사용량을 줄여 더 큰 아키텍처를 효율성 손실 없이 구현할 수 있음을 입증한다.
  • CWS-PResUNet와 타임도메인 모델인 Demucs 간의 베이스 및 드럼에 대한 성능 격차는 타임도메인 모델이 펄스성 및 밴드 제한된 소스에 대해 더 효과적일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.