Skip to main content
QUICK REVIEW

[논문 리뷰] Narrow-band Deep Filtering for Multichannel Speech Enhancement

Xiaofei Li, Radu Horaud|arXiv (Cornell University)|2019. 11. 25.
Speech and Audio Processing참고 문헌 40인용 수 16
한 줄 요약

이 논문은 각 주파수 영역을 개별적으로 처리하는 공유된 장기 단기 기억망(LSTM)을 사용하는 다중채널 음성 향상 방법인 '노이즈 대역 깊은 필터링(narrow-band deep filtering)'을 제안한다. 이는 공유된 장기 단기 푸리에 변환(STFT) 도메인 LSTM 네트워크를 사용하여 각 주파수 영역을 독립적으로 처리하며, 노이즈가 섞인 다중채널 STFT 계수를 학습하고, 크기 비율 마스크, 복소 스펙트럼, 또는 공간 필터를 목표로 함으로써, 매우 적은 파rameter 수와 높은 일반화 능력을 바탕으로 뛰어난 음성 향상 성능과 자동 음성 인식(ASR) 성능을 달성한다. 이는 다양한 노이즈 유형과 화자에 대해 강력한 일반화 성능을 보인다.

ABSTRACT

In this paper, we address the problem of multichannel speech enhancement in the short-time Fourier transform (STFT) domain. A long short-time memory (LSTM) network takes as input a sequence of STFT coefficients associated with a frequency bin of multichannel noisy-speech signals. The network's output is the corresponding sequence of single-channel cleaned speech. We propose several clean-speech network targets, namely, the magnitude ratio mask, the complex STFT coefficients and the (smoothed) spatial filter. A prominent feature of the proposed model is that the same LSTM architecture, with identical parameters, is trained across frequency bins. The proposed method is referred to as narrow-band deep filtering. This choice stays in contrast with traditional wide-band speech enhancement methods. The proposed deep filtering is able to discriminate between speech and noise by exploiting their different temporal and spatial characteristics: speech is non-stationary and spatially coherent while noise is relatively stationary and weakly correlated across channels. This is similar in spirit with unsupervised techniques, such as spectral subtraction and beamforming. We describe extensive experiments with both mixed signals (noise is added to clean speech) and real signals (live recordings). We empirically evaluate the proposed architecture variants using speech enhancement and speech recognition metrics, and we compare our results with the results obtained with several state of the art methods. In the light of these experiments we conclude that narrow-band deep filtering has very good speech enhancement and speech recognition performance, and excellent generalization capabilities in terms of speaker variability and noise type.

연구 동기 및 목표

  • 다중채널 음성 향상에서 넓은 대역 딥러닝 방법의 한계, 특히 처리 잡음에 대한 민감성과 높은 파rameter 수에 대응하기 위해.
  • 노이즈 대역 처리—각 주파수 영역을 독립적으로 처리하는 것—이 비지도 학습 방법의 일반화 우수성을 유지하면서 동시에 딥러닝의 이점을 활용할 수 있는지 탐색하기 위해.
  • 노이즈 대역, 다중채널 LSTM 프레임워크 내에서 다양한 네트워크 목표(예: 크기 비율 마스크, 복소 STFT, 공간 필터)의 효과성을 조사하기 위해.
  • 모든 주파수 영역에 동일한 공유된 LSTM 아키텍처를 사용함으로써, 화자나 노이즈 유형에 특화된 적응 없이도 높은 성능을 달성할 수 있음을 입증하기 위해.
  • 노이즈 대역 설정에서 다양한 학습 목표를 사용할 경우 음성 향상 품질과 ASR 성능 간의 상충 관계를 평가하기 위해.

제안 방법

  • 각 STFT 주파수 영역을 공유된 장기 단기 푸리에 변환(STFT) 도메인 LSTM 네트워크를 사용하여 독립적으로 처리한다.
  • LSTM의 입력은 특정 주파수 영역에 대한 다중채널 STFT 계수의 시계열이며, 출력은 청소된 음성 추정치의 시계열이다.
  • 네 가지 학습 목표를 탐색한다: 크기 비율 마스크(MRM), 복소 STFT 계수(CC), 공간 필터(SF), 스무딩된 공간 필터(SSF).
  • LSTM 메모리 셀을 통해 시간적 동적 특성을 활용하고, 다중채널 입력을 통해 공간적 다양성을 활용하며, 음성을 비정상적이고 공명성을 가지며, 노이즈를 정상적이고 상관성이 없는 것으로 모델링한다.
  • 모든 주파수 영역에서 동일한 네트워크 아키텍처와 파ram터를 사용함으로써 파ram터 효율성과 강력한 일반화 능력을 확보한다.
  • 전체 대역 방법와 달리 주파수 간 상관관계를 모델링하지 않기 때문에 넓은 대역 처리 잡음이 발생하지 않는다.

실험 결과

연구 질문

  • RQ1노이즈 대역 주파수별 깊은 필터링 접근 방식이 다중채널 음성 향상에서 넓은 대역 딥러닝 방법보다 우수한 성능을 낼 수 있는가?
  • RQ2노이즈 대역 설정에서 다양한 네트워크 목표(MRM, CC, SF, SSF)가 음성 향상 및 자동 음성 인식(ASR) 성능에 미치는 영향은 어떠한가?
  • RQ3모든 주파수 영역에 걸쳐 단일 공유 LSTM을 학습함으로써 성능 유지는 유지하면서 모델 복잡성과 데이터 요구량을 줄일 수 있는가?
  • RQ4넓은 대역 대비 노이즈 대역 접근 방식이 화자 신원과 노이즈 유형 간에 얼마나 잘 일반화되는가?
  • RQ5넓은 대역 스펙트럼 모델링이 생략됨으로써 ASR 성능을 떨어뜨리는 처리 잡음이 감소하는가?

주요 결과

  • 노이즈 대역 깊은 필터링 방법은 120만 개의 파rameter만으로도 최신 기술 수준의 음성 향상 성능을 달성하였으며, 이는 넓은 대역 모델인 WB-BLSTM2-SF(5460만 개의 파rameter)보다 훨씬 적은 수치이다.
  • BLSTM-SSF 버전은 4채널 평가 세트에서 단어 오류률(WER) 8.20%를 기록하였으며, 이는 매우 큰 네트워크를 사용하는 고급 빔포밍 방법인 NN-GEV(WER: 8.06%)와 유사한 성능을 보였다.
  • 2채널 케이스에서는 제안된 방법이 BLSTM-SSF를 사용하여 WER 8.76%를 기록하였으며, 이는 빔포밍 및 넓은 대역 방법보다 ASR 성능에서 뛰어나다.
  • 복소 계수(CC)와 공간 필터(SF) 목표는 특히 4채널 환경에서 더 rich한 공간적 특징 덕분에 크기 비율 마스크(MRM) 목표보다 더 우수한 음성 향상 성능을 보였다.
  • 공간 필터를 스무딩한 SSF는 시간적 요동을 줄여 ASR 성능을 향상시켰지만, 객관적 음성 향상 지표는 略도 저하되었다.
  • 모델은 노이즈 대역 및 파rameter 공유 설계 덕분에 화자 변동성과 노이즈 유형 간에 잘 일반화되며, 재학습 없이도 강력한 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.