Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Transform: Cocktail Party Source Separation via Complex Convolution in a Deep Neural Network

Andrew Simpson|arXiv (Cornell University)|2015. 04. 12.
Speech and Audio Processing참고 문헌 9인용 수 4
한 줄 요약

이 논문은 복소수 컨volution 레이어 내에서 원형 통계를 사용하여 복잡한 스펙트로그램을 모델링함으로써 코ctail party 소스 분리 작업을 수행하는 딥 네ural 네트워크 프레임워크인 Deep Transform를 제안한다. 확률적 단계 모델링을 통해 크기 및 단계 성분을 동시에 추정함으로써, 이 방법은 바이너리 마스크 기반 접근법과 유사한 분리 성능를 달성하며, 음성 분리에 복소수 기반 딥 러닝의 실현 가능성을 입증한다.

ABSTRACT

Convolutional deep neural networks (DNN) are state of the art in many engineering problems but have not yet addressed the issue of how to deal with complex spectrograms. Here, we use circular statistics to provide a convenient probabilistic estimate of spectrogram phase in a complex convolutional DNN. In a typical cocktail party source separation scenario, we trained a convolutional DNN to re-synthesize the complex spectrograms of two source speech signals given a complex spectrogram of the monaural mixture - a discriminative deep transform (DT). We then used this complex convolutional DT to obtain probabilistic estimates of the magnitude and phase components of the source spectrograms. Our separation results are on a par with equivalent binary-mask based non-complex separation approaches.

연구 동기 및 목표

  • 소스 분리에서 복소수 스펙트로그램을 적절히 다루는 딥 네URAL 네트워크 방법의 부족을 해결하기 위해.
  • 단일 귀로 혼합된 신호에서 개별 음성 소스의 복소수 스펙트로그램을 재구성하는 판별적 딥 트랜스포트를 개발하기 위해.
  • 원형 통계를 사용하여 스펙트로그램 단계를 확률적으로 모델링하여 분리 정확도를 향상시키기 위해.
  • 최신 기술인 바이너리 마스크 기반 분리 기법과 동등한 성능을 달성하기 위해.
  • 음성 소스 분리에 복소수 컨볼루션을 적용한 딥 네럴 네트워크의 효과성을 입증하기 위해.

제안 방법

  • 이 방법은 복소수 스펙트로그램을 직접 처리하는 복소수 컨volution 레이어를 갖춘 복소수 컨volution 신경망(CNN)을 사용하여 단계 정보를 유지한다.
  • 스펙트로그램의 단계 성분은 바이어스 분포를 사용하여 원형 통계로 모델링되어 확률적 단계 추정이 가능해진다.
  • 네트워크는 단일 귀로 혼합된 스펙트로그램에서 두 개의 음성 소스 스펙트로그램을 재구성하도록 훈련된다.
  • 모델은 각 소스의 크기 및 단계에 대한 확률적 추정치를 출력하여 일관된 신호 재합성 가능성을 확보한다.
  • 복소수 영역에서의 재구성 오차를 최소화하는 판별적 훈련 목적이 설정되어 있으며, 스펙트럼 크기 및 단계 양쪽을 최적화한다.
  • 최종 분리는 추정된 복소수 스펙트로그램의 역 푸리에 변환을 통해 달성된다.

실험 결과

연구 질문

  • RQ1딥 네럴 네트워크는 음성 소스 분리에 있어 복소수 스펙트로그램을 효과적으로 모델링할 수 있는가?
  • RQ2원형 통계를 통한 확률적 단계 추정은 분리 성능를 어떻게 향상시키는가?
  • RQ3복소수 컨볼루션 네트워크는 크기만 고려하는 방법보다 성능이 뛰어나거나 동등한가?
  • RQ4복소수 영역에서 크기 및 단계를 동시에 추정하는 것이 바이너리 마스크 기반 방법과 유사한 결과를 낼 수 있는가?
  • RQ5코ctail party 환경에서 복소수 스펙트로그램 재구성의 엔드 투 엔드 학습이 가능하고 효과적인가?

주요 결과

  • 제안된 Deep Transform는 바이너리 마스크 기반 비-복소수 접근법과 유사한 분리 성능를 달성하여 그 효과성을 입증한다.
  • 원형 통계를 통한 확률적 단계 모델링은 딥 네트워크 내에서 정확하고 일관된 단계 추정을 가능하게 한다.
  • 복소수 컨볼루션 아키텍처는 단일 귀로 혼합된 신호에서 소스 신호의 크기 및 단계를 성공적으로 재구성하는 데 기여한다.
  • 이 방법은 크기만 고려하는 표현에 의존하지 않고도 복소수 영역에서 딥 네럴 네트워크를 효과적으로 훈련시킬 수 있음을 보여준다.
  • 결과적으로 복소수 스펙트로그램 영역에서 크기 및 단계를 동시에 추정하는 것이 고품질의 소스 분리 결과를 이끌어낸다.
  • 이 방법은 두 개의 겹치는 음성 소스가 존재하는 일반적인 코ctail party 상황에서도 뛰어난 강건성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.