[논문 리뷰] Speech Emotion Recognition Based on Multi-feature and Multi-lingual Fusion
이 논문은 저자원 환경에서 정확도를 향상시키기 위해 다중 특징 및 다국어 융합 접근법을 제안한다. 중국어 및 영어 음성 데이터셋에서 수작업으로 만든 특징과 딥 뉴럴 네트워크 특징을 결합하고, 내어-언어 및 상호-언어 수준에서 융합함으로써, 특히 소규모 데이터셋에서 기준 모델 대비 뚜렷한 정확도 향상을 달성한다.
A speech emotion recognition algorithm based on multi-feature and Multi-lingual fusion is proposed in order to resolve low recognition accuracy caused by lack of large speech dataset and low robustness of acoustic features in the recognition of speech emotion. First, handcrafted and deep automatic features are extracted from existing data in Chinese and English speech emotions. Then, the various features are fused respectively. Finally, the fused features of different languages are fused again and trained in a classification model. Distinguishing the fused features with the unfused ones, the results manifest that the fused features significantly enhance the accuracy of speech emotion recognition algorithm. The proposed solution is evaluated on the two Chinese corpus and two English corpus, and is shown to provide more accurate predictions compared to original solution. As a result of this study, the multi-feature and Multi-lingual fusion algorithm can significantly improve the speech emotion recognition accuracy when the dataset is small.
연구 동기 및 목표
- 대규모 음성 데이터셋이 부족한 상황에서 음성 정서 인식의 낮은 정확도 문제를 해결한다.
- 다양한 특징 유형을 언어 간에 통합함으로써 음성 특징의 강건성을 향상시킨다.
- 다국어 데이터 융합을 통해 모델의 일반화 능력과 성능을 향상시킨다.
- 저자원 환경에서 특징 융합 전략의 효과성을 평가한다.
- 다양한 언어에서 수작업 특징과 딥 뉴럴 특징을 융합함으로써 정서 인식 정확도가 향상됨을 입증한다.
제안 방법
- 기존 중국어 및 영어 음성 정서 인식 데이터셋에서 수작업 특징(예: 프로소딕, 스펙트럼)과 딥 뉴럴 네트워크 특징(예: DNN에서 유도된 특징)을 추출한다.
- 각 언어 내부에서 다중 특징 유형을 별도로 융합하여 표현을 풍부하게 한다.
- 중국어 및 영어에서 융합된 특징을 상호-언어 융합하여 통합된 다국어 표현을 생성한다.
- 최종 융합된 특징 표현을 기반으로 분류 모델을 훈련시어 정서 카테고리를 예측한다.
- 융합된 특징과 융합되지 않은 특징를 비교함으로써 융합 전략의 효과성을 검증한다.
- 다양한 언어 간 일반화 능력을 확보하기 위해 중국어 및 영어 음성 정서 코퍼스 두 개씩을 대상으로 평가를 수행한다.
실험 결과
연구 질문
- RQ1수작업 특징과 딥 뉴럴 특징을 융합함으로써 음성 정서 인식 정확도가 향상되는가?
- RQ2중국어 및 영어 데이터셋에서 유도된 특징을 다국어로 융합하면 모델 성능이 향상되는가?
- RQ3학습 데이터가 제한된 상황에서 특징 융합이 정확도에 어떤 영향을 미치는가?
- RQ4제안된 융합 전략은 개별 특징 유형이나 단일 언어 데이터를 사용하는 것보다 더 효과적인가?
- RQ5저자원 환경에서 다국어 특징 융합은 강건성과 일반화 능력을 얼마나 향상시키는가?
주요 결과
- 제안된 다중 특징 및 다국어 융합 방법은 융합되지 않은 특징 또는 단일 특징 표현을 사용하는 모델에 비해 음성 정서 인식 정확도를 뚜렷이 향상시킨다.
- 중국어 및 영어 데이터셋에서 유도된 융합 특징는 단일 언어에서의 특징보다 더 강건하고 구분력 있는 표현을 제공한다.
- 소규모 데이터셋에서도 높은 정확도를 달성하여 언어 간 강력한 일반화 능력을 입증한다.
- 수작업 특징과 딥 뉴럴 특징의 조합은 특히 데이터가 적은 환경에서 모델 성능을 향상시킨다.
- 중국어 및 영어 코퍼스 두 개에서의 실증적 결과는 다양한 데이터셋 간 일관된 성능 향상을 확인한다.
- 연구는 이미 융합된 특징을 상호-언어 수준에서 융합하는 것이 내어-언어 융합만으로 하는 것보다 더 좋은 결과를 낸다는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.