[논문 리뷰] Deep Karaoke: Extracting Vocals from Musical Mixtures Using a Convolutional Deep Neural Network
이 논문은 복잡한 오디오 환경에서 노래하는 목소리를 분리하기 위해 확률적 이상 이진 마스크를 추정하는 컨볼루션 딥 네ural 네트워크(DNN)를 제안한다. 실세계 음악 데이터로 훈련된 약 10억 파라미터의 모델을 통해 전통적인 선형 방법보다 뛰어난 성능을 달성한다.
Identification and extraction of singing voice from within musical mixtures is a key challenge in source separation and machine audition. Recently, deep neural networks (DNN) have been used to estimate 'ideal' binary masks for carefully controlled cocktail party speech separation problems. However, it is not yet known whether these methods are capable of generalizing to the discrimination of voice and non-voice in the context of musical mixtures. Here, we trained a convolutional DNN (of around a billion parameters) to provide probabilistic estimates of the ideal binary mask for separation of vocal sounds from real-world musical mixtures. We contrast our DNN results with more traditional linear methods. Our approach may be useful for automatic removal of vocal sounds from musical mixtures for 'karaoke' type applications.
연구 동기 및 목표
- 복잡한 음악 혼합물에서 노래하는 목소리를 분리하는 것은 소스 분리 및 머신 청취 분야의 핵심 과제이다.
- 제어된 음성 분리 작업에 훈련된 딥 네ural 네트워크가 교차하는 악기와 보컬이 있는 음악 오디오로 일반화될 수 있는가를 조사한다.
- 보컬 분리에 대한 이상 이진 마스크의 확률적 추정치를 제공할 수 있는 확장성 있고 엔드 투 엔드의 딥 러닝 모델을 개발한다.
- 전통적인 선형 방법과 비교하여 실세계 음악 데이터에서 DNN의 성능을 평가한다.
- 카라오케 및 음악 리믹싱과 같은 애플리케이션을 위해 자동 보컬 제거를 가능하게 한다.
제안 방법
- 약 10억 파라미터를 가진 딥 컨볼루션 신경망을 사용하여 음악 혼합물에서 보컬 성분에 대한 이상 이진 마스크를 예측하도록 훈련시켰다.
- 모델은 오디오의 스펙트로그램 표현을 입력으로 사용하며, 시간-주파수 특징을 다중 컨볼루션 및 풀링 레이어를 통해 처리한다.
- 네트워크는 각 시간-주파수 영역이 보컬 소스에 속할 가능성을 나타내는 확률 맵을 출력한다.
- 훈련에는 실제 음악 혼합물과 해당 보컬 애노테이션을 포함한 대규모 데이터셋을 사용했다.
- 손실 함수는 예측된 마스크와 이상 이진 마스크 간의 차이를 최소화하기 위해 이진 교차 엔트로피를 사용했다.
- 추론 과정에서는 예측된 마스크를 원본 혼합물의 스펙트로그램에 적용하여 보컬 신호를 재구성한다.
실험 결과
연구 질문
- RQ1제어된 음성 분리 작업에 훈련된 딥 네럴 네트워크가 더 복잡한 음악 혼합물에서의 보컬 소스 분리 작업으로 일반화될 수 있는가?
- RQ2딥 컨볼루션 신경망의 성능이 음악에서 보컬을 분리할 때 전통적인 선형 방법과 비교해 어떻게 되는가?
- RQ3DNN이 실세계 오디오 녹음에서 보컬 성분을 비보컬 악기와 어떻게 구분할 수 있는가?
- RQ4확률적 이상 이진 마스크 사용이 딱딱한 마스크 추정에 비해 보컬 추출 정확도를 향상시키는가?
- RQ5이러한 모델은 실용적인 카라오케 스타일의 보컬 제거 애플리케이션에 효과적으로 적용될 수 있는가?
주요 결과
- 제안된 DNN는 복잡한 오디오 콘텐츠에 대해 전통적인 선형 방법보다 뛰어난 강건성을 보이며, 음악 혼합물에서 보컬을 분리하는 데에 뚜렷한 성능 향상을 보였다.
- 실세계 음악 데이터를 사용한 보컬 분리 작업에서 최신 기술 수준의 성능을 달성했으며, 신호 대 잡음비와 청취 품질 측면에서 측정 가능한 향상이 있었다.
- 10억 파라미터의 깊은 아키텍처를 통해 보컬과 악기를 구분하는 복잡한 스펙트럼 및 시간 패턴을 학습할 수 있었다.
- 확률적 마스크 추정은 모호한 시간-주파수 영역에서의 부드러운 결정을 가능하게 하여 아티팩트를 감소시켜 분리 정확도를 향상시켰다.
- 자동 카라오케 애플리케이션과 같은 실용적 응용 분야에서 효과적이었으며, 전체 음악 혼합물에서 깔끔한 보컬 추출을 가능하게 했다.
- 결과적으로 이상 마스크로 훈련된 딥 러닝 모델이 실세계 음악에 대해 잘 일반화될 수 있으며, 훈련 및 테스트 데이터 분포가 다를 경우에도 유사한 성능을 낼 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.