Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi Level Data Fusion Approach for Speaker Identification on Telephone Speech

Imen Trabelsi, Dorra Ben Ayed Mezghanni|arXiv (Cornell University)|2014. 06. 27.
Speech and Audio Processing참고 문헌 17인용 수 5
한 줄 요약

이 논문은 GMM로 모델링된 보완적인 특징(MFCC 및 RASTA-PLP)을 SVM 및 나이브 베이즈 분류기로 융합하는 다수준 데이터 융합 기반의 복잡한 음성 환경에서의 텍스트 독립적 발화자 식별 방법을 제안한다. 다양한 특징 세트와 학습 모델의 융합은 노이즈가 많은 NTIMIT 데이터베이스에서 성능을 크게 향상시키며, 음성의 열악한 조건에 대해 뛰어난 내성성을 보여준다.

ABSTRACT

Several speaker identification systems are giving good performance with clean speech but are affected by the degradations introduced by noisy audio conditions. To deal with this problem, we investigate the use of complementary information at different levels for computing a combined match score for the unknown speaker. In this work, we observe the effect of two supervised machine learning approaches including support vectors machines (SVM) and naïve bayes (NB). We define two feature vector sets based on mel frequency cepstral coefficients (MFCC) and relative spectral perceptual linear predictive coefficients (RASTA-PLP). Each feature is modeled using the Gaussian Mixture Model (GMM). Several ways of combining these information sources give significant improvements in a text-independent speaker identification task using a very large telephone degraded NTIMIT database.

연구 동기 및 목표

  • 실제 전화 음성 환경에서의 노이즈로 인한 발화자 식별 성능 저하 문제를 해결하기 위해.
  • MFCC 및 RASTA-PLP와 같은 다양한 특징 세트의 융합이 시스템의 내성성 향상에 기여하는지 탐색하기 위해.
  • 특징, 점수, 분류기 수준에서의 다양한 융합 전략이 시스템 정확도에 미치는 영향을 평가하기 위해.
  • SVM 및 나이브 베이즈와 같은 지도 학습 모델이 보완적인 특징에서의 증거를 융합하는 데서 수행하는 역할을 조사하기 위해.
  • 대규모이며 열악한 조건의 전화 음성 데이터베이스(NTIMIT)를 사용하여 텍스트 독립적 발화자 식별에서 뚜렷한 성능 향상이 이루어지는지 입증하기 위해.

제안 방법

  • 저자는 메르 주파수 케플스트럼 계수(MFCC)와 상대 스펙트럼 청각 선형 예측(RASTA-PLP) 계수라는 두 가지 독립적인 특징 세트를 추출한다.
  • 각 특징 세트는 발화자별로 구분 가능한 가능도 점수를 생성하기 위해 독립적으로 가우시안 믹스처 모델(GMM)로 모델링된다.
  • 두 특징 세트의 매칭 점수는 SVM 및 나이브 베이즈를 사용하여 특징 수준 융합, 점수 수준 융합, 분류기 수준 융합 등 여러 수준에서 융합된다.
  • 다양한 특징 표현 방식에서 온 보완적인 정보를 통합하여 열악한 조건에서도 분류 능력을 향상시키는 융합 전략이 적용된다.
  • 시스템은 실제 전화 음성 조건을 시뮬레이션하는 대규모 노이즈가 있는 NTIMIT 데이터베이스에서 학습 및 평가된다.
  • 표준 발화자 식별 지표를 사용하여 성능을 평가하며, 음향적 열악함에 대한 내성성에 중점을 둔다.

실험 결과

연구 질문

  • RQ1MFCC와 RASTA-PLP 특징을 융합할 경우, 노이즈가 많은 전화 음성 환경에서 발화자 식별 성능이 어떻게 향상되는가?
  • RQ2다양한 특징 융합 전략에서 SVM 및 나이브 베이즈 분류기의 상대적 기여도는 어떠한가?
  • RQ3특징, 점수, 분류기 수준에서의 다수준 융합 전략이 단일 수준 또는 단일 특징 접근 방식보다 얼마나 뛰어나게 성능을 향상시키는가?
  • RQ4다양한 융합 전략이 노이즈가 많은 실제 전화 환경에서의 시스템 내성성에 어떤 영향을 미치는가?
  • RQ5다양한 특징 표현 방식이 발화자 식별 시스템에서 음성의 열악한 조건으로 인한 성능 저하를 완화하는 데 기여할 수 있는가?

주요 결과

  • MFCC와 RASTA-PLP 특징의 융합은 단독으로 사용할 경우보다 발화자 식별 정확도를 크게 향상시킨다.
  • GMM 기반 모델링과 점수 및 분류기 수준에서의 SVM 및 나이브 베이즈 분류기 융합은 NTIMIT 데이터베이스에서 뚜렷한 성능 향상을 이룬다.
  • 다수준 융합 전략, 특히 점수 수준 융합이 가장 높은 성능을 기록하며, 다양한 처리 단계에서의 증거 통합의 효과성을 입증한다.
  • 제안된 접근 방식은 열악한 조건에서도 높은 정확도를 유지하며, 뛰어난 내성성을 보여준다.
  • 다양한 특징 세트에서 온 보완적인 정보가 텍스트 독립적 발화자 식별 작업에서 시스템의 신뢰성과 분류 능력을 향상시킨다는 것이 확인된다.
  • 지도 학습 모델(SVM 및 나이브 베이즈)이 다중 소스 정보 융합을 통해 발화자 인식 성능을 향상시키는 데 효과적이라는 것이 연구를 통해 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.