Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Filtering: Signal Extraction Using Complex Time-Frequency Filters.

Wolfgang Mack, Emanuël A. P. Habets|arXiv (Cornell University)|2019. 04. 17.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 단일 채널 음성 분리에 대해 복소 시간주파수 필터를 추정하는 데 깊이 있는 신경망을 사용하는 Deep Filtering를 제안한다. 이 방법은 지도 학습을 위한 진짜 필터를 요구하지 않고 직접 복구 오차를 최소화한다. 특히 노치 필터링과 시간프레임 제로화와 같은 도전적인 조건에서도 실시간 및 복소 TF 마스크 기반 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Signal extraction from a single-channel mixture with additional undesired signals is most commonly performed using time-frequency (TF) masks. Typically, the mask is estimated with a deep neural network (DNN) and element-wise applied to the complex mixture short-time Fourier transform (STFT) representation to perfom extraction. Ideal mask magnitudes are zero for solely undesired signals in a TF bin and infinity for total destructive interference. Usually, masks have an upper bound to provide well-defined DNN outputs at the cost of limited extraction capabilities. We propose to estimate with a DNN a complex TF filter for each mixture TF bin which maps an STFT area in the respective mixture to the desired TF bin to address destructive interference in mixture TF bins. The DNN is optimized by minimizing the error between the extracted and the groundtruth desired signal allowing to train without having to specify ground-truth TF filters but learn filters by error reduction. We compare our approach with complex and real valued TF masks by separating speech from a variety of different sound and noise classes from the Google AudioSet corpus. We also process the mixture STFT with notch filters and zero whole time-frames to demonstrate the reconstruction capabilities of our approach. The proposed method outperformed the baselines especially when notch filters and time-frame zeroing were applied.

연구 동기 및 목표

  • 단일 채널 음성 분리 과정에서 시간주파수 마스크가 파괴적 간섭을 다루는 데에 한계가 있음을 해결하기 위해.
  • 마스크 추정에서 상한선으로 인해 발생하는 네트워크 출력 안정성과 추출 능력 간의 상충관계를 극복하기 위해.
  • 지도 학습을 위한 진짜 필터를 요구하지 않고도 복소 시간주파수 필터의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 실제 세계 조건에서 스펙트럼 왜곡, 예를 들어 노치 필터링과 시간프레임 제로화에 대해 강건성을 입증하기 위해.

제안 방법

  • 혼합 신호의 STFT 각 시간주파수(주파수-시간) 영역에 대해 깊이 있는 신경망을 통해 복소 시간주파수 필터를 예측한다.
  • 예측된 필터를 사용해 각 TF 영역 주변의 STFT 영역을 목표 신호 성분으로 매핑함으로써 간섭 완화를 가능하게 한다.
  • 추출된 신호와 진짜 목표 신호 간의 복구 오차를 최소화하여 네트워크를 최적화한다.
  • 혼합 신호의 복소 STFT 표현을 입력으로 사용하고, 시간주파수 도메인에서 직접 작용하는 필터를 예측한다.
  • 학습 중 오차 역전파에 의존함으로써 명시적인 진짜 필터가 필요 없도록 한다.
  • 각 주파수-시간 영역 별로 혼합 신호의 STFT를 필터링하여 목표 신호를 재구성한다.

실험 결과

연구 질문

  • RQ1지도 학습을 위한 진짜 필터가 없이도 깊이 있는 신경망이 효과적인 복소 시간주파수 필터를 학습할 수 있는가?
  • RQ2제안된 필터 기반 접근법은 기존의 실수 및 복소 시간주파수 마스크 방법과 비교해 분리 품질 측면에서 어떻게 성능을 내는가?
  • RQ3노치 필터링과 시간프레임 제로화와 같은 스펙트럼 열악한 조건에서 제안된 방법이 얼마나 높은 성능를 유지하는가?
  • RQ4제약된 출력을 가진 마스크 기반 방법과 비교해 신호 복구 오차를 통한 엔드 투 엔드 최적화가 더 나은 일반화 성능을 이끌어내는가?

주요 결과

  • 제안된 Deep Filtering 방법은 음성 분리 과업에서 실수 및 복소 시간주파수 마스크 기반 방법을 모두 능가했다.
  • 노치 필터링에 의해 열악해진 혼합 신호 처리 시 뛰어난 강건성을 보여, 스펙트럼 노른(Null)을 더 잘 다루는 것으로 나타났다.
  • 전체 시간프레임이 제로화된 상황에서도 높은 성능를 유지해 강력한 신호 재구성 능력을 보였다.
  • 필터 추정에 상한선이 없어, 제약된 마스크 방법 대비 간섭 성분을 더 효과적으로 억제할 수 있었다.
  • 네트워크는 혼합 신호의 STFT 영역을 목표 TF 영역로 매핑하는 것을 학습해, 학습된 복소 필터링을 통해 정밀한 신호 추출을 가능하게 했다.
  • 특히 어려운 스펙트럼 조건에서 다양한 노이즈 및 사운드 클래스를 포함한 Google AudioSet 코퍼스에서 최신 기술 수준의 성능를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.