Skip to main content
QUICK REVIEW

[논문 리뷰] A Study of Language and Classifier-independent Feature Analysis for Vocal Emotion Recognition

Fatemeh Noroozi, Marina Marjanović|arXiv (Cornell University)|2018. 11. 14.
Speech and Audio Processing참고 문헌 1인용 수 5
한 줄 요약

이 논문은 음성 정서 인식을 위한 언어 및 분류기 독립적인 특징 선택 프레임워크를 제안하며, 특징 순위 매기기, 언어 및 분류기별 특징 부분집합 식별, 최신 필터 기반 방법과의 성능 비교를 포함하는 삼단계 과정을 사용한다. 이 방법은 폴란드어, 세르비아어, 영어 등 다양한 언어와 KNN, SVM, 신경망 등 다양한 분류기에서 뛰어난 인식 성능를 달성하며, 핵심 기여로는 여러 언어와 분류기 간에 일관되게 효과적인 6개의 공통 특징($x_{34}, x_{36}, x_{39}, x_{42}, x_{52}, x_{60}, x_{67}, x_{84}$)을 식별하는 데 있다.

ABSTRACT

Every speech signal carries implicit information about the emotions, which can be extracted by speech processing methods. In this paper, we propose an algorithm for extracting features that are independent from the spoken language and the classification method to have comparatively good recognition performance on different languages independent from the employed classification methods. The proposed algorithm is composed of three stages. In the first stage, we propose a feature ranking method analyzing the state-of-the-art voice quality features. In the second stage, we propose a method for finding the subset of the common features for each language and classifier. In the third stage, we compare our approach with the recognition rate of the state-of-the-art filter methods. We use three databases with different languages, namely, Polish, Serbian and English. Also three different classifiers, namely, nearest neighbour, support vector machine and gradient descent neural network, are employed. It is shown that our method for selecting the most significant language-independent and method-independent features in many cases outperforms state-of-the-art filter methods.

연구 동기 및 목표

  • 음성 정서 인식을 위한 언어와 분류 알고리즘에 관계없이 적용 가능한 특징 선택 방법을 개발하는 것.
  • 정서 인식 시스템에서 고차원적이고 상관관계가 높으며 언어에 의존하는 특징의 과제를 해결하는 것.
  • 다양한 언어와 분류기 간에 높은 성능를 유지하는 최소한의 강력한 특징 집합을 식별하는 것.
  • 계산 복잡도를 줄이면서도 기존의 필터 기반 특징 선택 방법보다 높은 인식 정확도를 달성하는 것.

제안 방법

  • 단계 1: 최신 음성 품질 특징 기반의 특징 순위 매기기 방법을 제안하여 관련성과 구분 능력을 우선시한다.
  • 단계 2: 순위 기반 전략을 사용하여 언어별 및 분류기별 특징 부분집합을 식별하여 각 언어와 분류기별로 최고 성능를 보이는 특징을 선별한다.
  • 단계 3: 세 개의 데이터베이스(Polish, Serbian, English)와 세 개의 분류기(KNN, SVM, 신경망)를 사용하여 제안된 방법의 인식 성능를 최신 필터 기반 방법과 비교한다.
  • 통계적 순위 매기기와 교차 검증 기반 성능 평가를 융합한 하이브리드 특징 선택 전략을 적용하여 공통적이고 영향력 있는 특징을 분리한다.
  • 모든 데이터셋에서 동일한 84개의 음성 품질 특징(피치, 형성, MFCC, FBE, 스펙트럼 특징 포함)을 통합된 특징 세트로 사용한다.
  • 모든 언어에서 일관성 있고 공정한 평가를 보장하기 위해 동일한 특징 추출 파이프라인을 적용한다.

실험 결과

연구 질문

  • RQ1언어와 분류기 모두에 독립적이면서도 높은 인식 정확도를 유지할 수 있는 특징 선택 방법을 설계할 수 있는가?
  • RQ2다양한 언어와 분류기에서 음성 품질 특징 중 어떤 부분집합이 가장 일관되게 구분 능력이 높은가?
  • RQ3제안된 방법은 다국어 정서 인식에서 기존의 필터 기반 특징 선택 기법과 비교해 성능가 어떻게 다른가?
  • RQ4다양한 언어적 조건과 분류기 조건에서 높은 인식 성능를 달성할 수 있는 최소한의 특징 집합은 무엇인가?
  • RQ5언어별 및 분류기별 특징 부분집합 간의 차이 정도는 어느 정도이며, 공통 핵심 특징을 어떻게 식별할 수 있는가?

주요 결과

  • 제안된 방법은 모든 테스트된 언어와 분류기에서 최신 필터 기반 방법보다 높은 인식 정확도를 달성한다.
  • 핵심 6개의 특징—$x_{34}, x_{36}, x_{39}, x_{42}, x_{52}, x_{60}, x_{67}, x_{84}$—이 폴란드어, 세르비아어, 영어 데이터셋 전반에서 일관되게 효과적인 것으로 나타났다.
  • 각 분류기당 상위 22개의 특징만으로도 높은 인식 성능를 달성하여 효율성과 강건성을 입증했다.
  • 분류기 독립적 특징 선택은 KNN, SVM, 신경망 전반에서 높이 관련된 특징으로 $x_{21}, x_{22}, x_{26}, x_{28}, x_{29}, x_{33}, x_{63}, x_{66}, x_{67}, x_{79}, x_{84}$를 식별했다.
  • 언어별 특징 부분집합은 상당한 차이를 보였지만, 상위 특징 간의 겹침은 크기 때문에 보편적인 정서 신호 존재를 검증했다.
  • 통합된 순위 매기기 전략을 사용함으로써, 후속 분류기와 무관하게 높은 성능를 보이는 특징을 일관되게 식별할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.