Skip to main content
QUICK REVIEW

[논문 리뷰] Is CQT more suitable for monaural speech separation than STFT? an empirical study

Ziqiang Shi, Huibin Lin|arXiv (Cornell University)|2019. 02. 02.
Speech and Audio Processing참고 문헌 19인용 수 7
한 줄 요약

이 논문은 단일 귀 음성 분리의 프론트엔드로 상수 Q 변환(CQT)이 단기 푸리에 변환(STFT)보다 우수한지 여부를 조사한다. WSJ0-2mix 코퍼스를 사용하여 저자들은 CQT 기반 모델이 STFT 기반 방법보다 평균 0.4 dB의 신호 대 간섭비(SDR) 향상을 보임을 경험적으로 입증한다. 이는 CQT의 비선형 주파수 해상도가 인간 청각 인지에 더 가까이 모방하기 때문이다.

ABSTRACT

Short-time Fourier transform (STFT) is used as the front end of many popular successful monaural speech separation methods, such as deep clustering (DPCL), permutation invariant training (PIT) and their various variants. Since the frequency component of STFT is linear, while the frequency distribution of human auditory system is nonlinear. In this work we propose and give an empirical study to use an alternative front end called constant Q transform (CQT) instead of STFT to achieve a better simulation of the frequency resolving power of the human auditory system. The upper bound in signal-to-distortion (SDR) of ideal speech separation based on CQT's ideal ration mask (IRM) is higher than that based on STFT. In the same experimental setting on WSJ0-2mix corpus, we examined the performance of CQT under different backends, including the original DPCL, utterance level PIT, and some of their variants. It is found that all CQT-based methods are better than STFT-based methods, and achieved on average 0.4dB better performance than STFT based method in SDR improvements.

연구 동기 및 목표

  • CQT의 비선형 주파수 해상도를 활용하여 CQT가 단일 귀 음성 분리에 더 적합한지 평가하기 위해.
  • STFT의 선형 주파수 버킷이 인간 청각 인지와 일치하지 않는 한계를 해결하기 위해.
  • 표준화된 설정에서 여러 딥러닝 백엔드를 통해 CQT와 STFT를 경험적으로 비교하기 위해.
  • CQT 기반 이상 비율 마스크(IRMs)가 STFT 기반 IRMs보다 더 높은 상한선 SDR를 제공하는지 확인하기 위해.
  • DPCL 및 PIT 변형을 포함한 다양한 학습 프레임워크에서 CQT 향상 효과의 일반화 가능성 평가하기 위해.

제안 방법

  • 단일 귀 음성 분리 모델의 표준 STFT 프론트엔드를 CQT로 대체하여 인간 청각 주파수 해상도를 더 잘 시뮬레이션하기 위해.
  • 상한선 성능 한계를 설정하기 위해 CQT 및 STFT 표현 기반의 이상 비율 마스크(IRMs)를 계산하기 위해.
  • 동일한 아키텍처와 하이퍼파라미터를 사용하여 프론트엔드 변환 방식(CQT 대비 STFT)만 다를 수 있도록 여러 모델을 훈련 및 평가하기 위해.
  • 딥 클러스터링(DPCL), 순열 불변 훈련(PIT) 및 그 변형과 같은 표준 단일 귀 분리 백엔드 적용하기 위해.
  • 모든 실험에서 일관된 평가를 위해 WSJ0-2mix 데이터셋 사용하기 위해.
  • 주요 지표로 신호 대 간섭비(SDR)를 사용하여 성능 측정하기 위해.

실험 결과

연구 질문

  • RQ1CQT 기반 이상 비율 마스크(IRMs)가 STFT 기반 이상 비율 마스크(IRMs)보다 더 높은 상한선 SDR를 달성하는가?
  • RQ2CQT 기반 모델이 DPCL 및 문장 수준의 PIT를 포함한 여러 딥러닝 백엔드에서 STFT 기반 모델보다 우수한가?
  • RQ3DPCL 및 PIT와 같은 다양한 학습 프레임워크에서 CQT의 성능 향상이 일관된가?
  • RQ4CQT의 비선형 주파수 해상도는 STFT의 선형 해상도에 비해 분리 성능 향상에 어느 정도 기여하는가?
  • RQ5CQT는 STFT보다 더 생물학적으로 타당한 프론트엔드로 음성 분리에 활용될 수 있는가?

주요 결과

  • CQT 기반 이상 비율 마스크(IRMs)는 STFT 기반 IRMs보다 더 높은 상한선 신호 대 간섭비(SDR)를 달성한다.
  • 모든 CQT 기반 모델이 DPCL 및 문장 수준의 PIT를 포함한 여러 백엔드에서 STFT 기반 대비 모델보다 뛰어나다.
  • WSJ0-2mix 코퍼스에서 CQT 기반 방법은 STFT 기반 방법 대비 평균 0.4 dB의 SDR 향상을 보인다.
  • 모델 변형 간 일관된 성능 향상으로 인해 CQT가 프론트엔드로써의 강건성을 입증한다.
  • 결과는 CQT의 비선형 주파수 해상도가 인간 청각 인지에 더 잘 부합하여 분리 성능 향상에 기여함을 시사한다.
  • 경험적 증거는 CQT가 상한선 성능뿐 아니라 실질적 성능 면에서도 단일 귀 음성 분리에서 STFT보다 열등한 대안이 되는 것으로 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.