[논문 리뷰] Gender Based Emotion Recognition System for Telugu Rural Dialects Using Hidden Markov Models
이 논문은 은폐 마르코프 모델(HMMs)을 활용하여 텔루구 농어 dialect의 성별 기반 정서 인식 시스템을 제안한다. 13개의 MFCC, 13개의 델타 계수, 13개의 가속도 계수로 구성된 39차원 특징 벡터를 사용하여 분노, 놀람, 기쁨, 슬픔, 중립의 다섯 가지 정서 상태를 분류한다. 시스템은 남성과 여성 모두에서 분노를 인식하는 데 80%의 정확도를 달성하였으며, 인간 평가에 의해 검증되었고, TRDAP 데이터베이스를 대상으로 성별에 따라 구분된 모델과 성별에 구애받지 않는 실험을 통해 성과가 입증되었다.
Automatic emotion recognition in speech is a research area with a wide range of applications in human interactions. The basic mathematical tool used for emotion recognition is Pattern recognition which involves three operations, namely, pre-processing, feature extraction and classification. This paper introduces a procedure for emotion recognition using Hidden Markov Models (HMM), which is used to divide five emotional states: anger, surprise, happiness, sadness and neutral state. The approach is based on standard speech recognition technology using hidden continuous markov model by selection of low level features and the design of the recognition system. Emotional Speech Database from Telugu Rural Dialects of Andhra Pradesh (TRDAP) was designed using several speaker's voices comprising the emotional states. The accuracy of recognizing five different emotions for both genders of classification is 80% for anger-emotion which is achieved by using the best combination of 39-dimensioanl feature vector for every frame (13 MFCCs, 13 Delta Coefficients and 13 Acceleration Coefficients) and a classifier using HMM. This outcome very much matches with that acquired with the same database with subjective evaluation by human judges. Both gender-dependent and gender-independent experiments are conducted on TRDAP emotional speech database.
연구 동기 및 목표
- 말하기 정서 연구에서 미흡하게 다뤄지는 텔루구 농어 dialect에 특화된 자동 정서 인식 시스템을 개발하는 것.
- 언어학적 및 음성 데이터가 제한된 저자원 지역 어원에서 정서 인식의 과제를 해결하는 것.
- 새로가 만들어진 정서 음성 데이터베이스를 바탕으로 성별에 따라 구분된 모델과 성별에 구애받지 않는 모델을 사용하여 HMM 기반 분류 성능을 평가하는 것.
- 지속적 HMM과 저수준 음성 특징을 활용하여 인도 지역어에서 정서 인식의 기준을 설정하는 것.
제안 방법
- 시스템은 사전 처리, 특징 추출, 분류의 세 단계로 구성된 패턴 인식 파이프라인을 사용한다.
- 저수준 음성 특징은 음성 프레임 단위로 추출되며, 13개의 멜 주파수 케플스트럼 계수(MFCCs), 13개의 델타 계수, 13개의 가속도 계수로 구성된 39차원 벡터를 형성한다.
- 은폐 마르코프 모델(HMMs)은 음성의 시간적 동역학을 모델링하기 위해 연속 HMM 프레임워크를 사용하여 각 정서 클래스별로 학습된다.
- TRDAP 데이터베이스는 여러 텔루구 농어 dialect의 화자들로부터 수집된 정서 음성을 포함하고 있으며, 학습 및 테스트에 사용된다.
- 성별에 따라 구분된 모델과 성별에 구애받지 않는 HMM 분류기를 동일한 데이터셋에서 학습하고 평가하여 성능을 비교한다.
- 표준 음성 인식 기법을 정서 분류에 적응하여 사용하며, 최대 우도 추정 기반의 모델 선택 기법을 적용한다.
실험 결과
연구 질문
- RQ1HMM 기반 분류는 텔루구 농어 dialect에서 분노, 놀람, 기쁨, 슬픔, 중립의 다섯 가지 정서를 효과적으로 인식할 수 있는가?
- RQ2성별에 맞춘 모델링은 저자원 지역 어원에서 정서 인식 정확도에 어떤 영향을 미치는가?
- RQ313개의 MFCC, 13개의 델타 계수, 13개의 가속도 계수로 구성된 39차원 음성 특징의 조합이 정서 인식 성능을 얼마나 향상시키는가?
- RQ4시스템의 성능는 동일한 데이터셋에서 인간의 주관적 평가와 비교하여 어떻게 평가되는가?
- RQ5지역 인도 언어에서 정서 인식에 가장 적합한 특징 벡터와 모델 구성은 무엇인가?
주요 결과
- 최적의 39차원 특징 벡터를 사용하여 시스템은 분노 인식에서 80%의 정확도를 달성하였으며, 다섯 가지 정서 클래스 중에서 가장 높은 성능이다.
- 성별에 따라 구분된 HMM 모델이 TRDAP 데이터베이스에서 성별에 구애받지 않는 모델보다 정서 인식 정확도에서 뛰어난 성능을 보였다.
- 시스템의 성능는 인간의 주관적 평가와 매우 유사하여 신뢰성과 강건성을 입증하였다.
- 13개의 MFCC, 13개의 델타 계수, 13개의 가속도 계수의 조합이 가장 뛰어난 분류 성능을 제공하였다.
- 지속적 HMM 프레임워크는 농어 텔루구 어원에서 정서 음성의 시간적 동역학을 효과적으로 모델링하였다.
- TRDAP 데이터베이스는 향후 인도 지역어 정서 인식 연구를 위한 유효하고 신뢰할 수 있는 기준이 되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.