Skip to main content
QUICK REVIEW

[논문 리뷰] Blind speech separation based on undecimated wavelet packet-perceptual filterbanks and independent component analysis

Ibrahim Missaoui, Zied Lachiri|arXiv (Cornell University)|2012. 10. 14.
Blind Source Separation Techniques참고 문헌 27인용 수 6
한 줄 요약

이 논문은 비모수적 음성 분리 시스템을 제안하며, 비감쇠 웨이블릿 패킷 분해(UWPD)와 청각적으로 조정된 필터뱅크, 그리고 첨도 최대화를 이용한 독립성 성분 분석(ICA)을 결합한다. 신호 표현에서 비정규성(non-Gaussianity)을 향상시킴으로써, 이 방법은 즉시 두 소스 음성 혼합에서 FastICA 및 기타 기준 기준보다 뛰어난 분리 성능을 달성한다.

ABSTRACT

In this paper, we address the problem of blind separation of speech mixtures. We propose a new blind speech separation system, which integrates a perceptual filterbank and independent component analysis (ICA) and using kurtosis criterion. The perceptual filterbank was designed by adjusting undecimated wavelet packet decomposition (UWPD) tree in order to accord to critical band characteristics of psycho-acoustic model. Our proposed technique consists on transforming the observations signals into an adequate representation using UWPD and Kurtosis maximization criterion in a new preprocessing step in order to increase the non-Gaussianity which is a pre-requirement for ICA. Experiments were carried out with the instantaneous mixture of two speech sources using two sensors. The obtained results show that the proposed method gives a considerable improvement when compared with FastICA and other techniques.

연구 동기 및 목표

  • 원천이나 혼합 조건에 대한 사전 지식 없이 혼합된 음성 신호를 분리하는 데 도전하는 것.
  • 효율적인 독립성 성분 분석(ICA)을 위한 전제 조건인 음성 신호의 비정규성(non-Gaussianity)을 향상시키는 것.
  • 인간 청각 임계대역 특성과 일치하는, 비감쇠 웨이블릿 패킷 분해(UWPD) 기반의 청각적 필터뱅크를 설계하는 것.
  • ICA 이전의 사전 처리 단계에서 첨도 최대화를 통합하여 분리 성능을 향상시키는 것.
  • 실세계 음성 혼합 시나리오에서 FastICA와 같은 기존 기법들과의 비교를 통해 제안된 방법을 검증하는 것.

제안 방법

  • 이 방법은 혼합된 음성 신호의 재귀적이고 이동 불변성 있는 시간-주파수 표현을 생성하기 위해 비감쇠 웨이블릿 패킷 분해(UWPD)를 사용한다.
  • 인간 청각 심리물리 모델의 임계대역 속도를 일치시키기 위해 UWPD 트리 구조를 최적화하여 청각적 필터뱅크를 구성한다.
  • 변환된 신호의 비정규성을 향상시켜 ICA 성능을 향상시키기 위해 사전 처리 단계에서 첨도 최대화 기준을 적용한다.
  • 비정규성 표현을 향상시킨 후, 독립성 성분 분석(ICA)을 적용하여 원래의 음성 원천을 분리한다.
  • 두 개의 센서를 사용하여 즉시 혼합된 두 음성 신호를 캡처함으로써 실세계 블라인드 소스 분리 시나리오를 시뮬레이션한다.
  • 목적적 지표를 사용하여 평가하며, 결과를 FastICA 및 기타 전통적 기법들과 비교한다.

실험 결과

연구 질문

  • RQ1비감쇠 웨이블릿 패킷 분해 기반의 청각적으로 유도된 필터뱅크가 음성 혼합의 비정규성을 향상시킬 수 있는가?
  • RQ2사전 처리 단계에서 첨도 최대화를 통합하면 블라인드 음성 분리에서 ICA 성능이 향상되는가?
  • RQ3제안된 UWPD-청각적 필터뱅크-ICA 시스템은 두 음성 원천 분리에서 FastICA 및 기타 기존 방법과 비교해 어떻게 성능을 내는가?
  • RQ4필터뱅크의 청각적 일치성이 신호 대 잡음비와 이해 가능성 측면에서 분리 품질을 얼마나 향상시키는가?
  • RQ5즉시 혼합 조건 하에서 음성 신호 특성의 변동에 대해 제안된 방법은 얼마나 강인한가?

주요 결과

  • 제안된 방법은 FastICA 및 기타 전통적 기법들에 비해 음성 분리 품질에서 뚜렷한 향상을 달성한다.
  • 사전 처리 단계에서 첨도 최대화를 통합함으로써 신호 표현의 비정규성이 효과적으로 향상되며, 이는 ICA 성공에 필수적인 요소이다.
  • 비감쇠 웨이블릿 패킷 분해를 사용함으로써 이동 불변성과 함께 음성 신호의 미세한 시간 구조를 유지한다.
  • 최적화된 UWPD 트리에서 유도된 청각적으로 조정된 필터뱅크는 인간 청각 인지와 더 잘 일치하여 분리 정밀도를 향상시킨다.
  • 실험 결과는 제안된 시스템이 분리 정확도와 신호 대 간섭비 측면에서 FastICA를 능가함을 보여준다.
  • 이 방법은 두 개의 센서만을 사용하여 두 음성 원천의 즉시 혼합에 효과적으로 작용함을 확인하여 실용적 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.