[논문 리뷰] Multi-Modal Emotion Recognition by Text, Speech and Video Using Pretrained Transformers
이 논문은 텍스트, 음성, 비디오 모odal리티를 위한 사전 훈련된 Transformer 모델을 사용하여 다중모态 정서 인식 프레임워크를 제안하며, 특징 수준의 연결과 SVM 분류를 활용한다. IEMOCAP 데이터셋에서 가장 성능이 뛰어난 모델은 75.42%의 정확도를 기록하여, 하이브리드 융합 전략을 사용한 미세조정된 다중모달 Transformer의 효과를 입증한다.
Due to the complex nature of human emotions and the diversity of emotion representation methods in humans, emotion recognition is a challenging field. In this research, three input modalities, namely text, audio (speech), and video, are employed to generate multimodal feature vectors. For generating features for each of these modalities, pre-trained Transformer models with fine-tuning are utilized. In each modality, a Transformer model is used with transfer learning to extract feature and emotional structure. These features are then fused together, and emotion recognition is performed using a classifier. To select an appropriate fusion method and classifier, various feature-level and decision-level fusion techniques have been experimented with, and ultimately, the best model, which combines feature-level fusion by concatenating feature vectors and classification using a Support Vector Machine on the IEMOCAP multimodal dataset, achieves an accuracy of 75.42%. Keywords: Multimodal Emotion Recognition, IEMOCAP, Self-Supervised Learning, Transfer Learning, Transformer.
연구 동기 및 목표
- 다양하고 복잡한 인간 정서를 다중 모달리티에서 인식하는 데 도전하는 것.
- 텍스트, 음성, 비디오 모달리티에서 강력한 특징 추출을 위해 사전 훈련된 Transformer 모델을 미세조정하는 것.
- 다중모달 정서 인식을 위한 다양한 특징 수준 및 의사결정 수준 융합 기법을 평가하고 비교하는 것.
- 다중모달 데이터에서 정확도를 최대화하기 위한 최적의 융합 전략과 분류기 조합을 규명하는 것.
제안 방법
- 텍스트, 음성(음성), 비디오 데이터에서 별도의 사전 훈련된 Transformer 모델을 미세조정하여 모달리티별 특징을 추출한다.
- 자기지도 학습(pretraining)을 수행한 후 미세조정을 통해 각 모달리티 내 정서적 구조를 포착한다.
- 모든 세 모달리티에서 추출된 특징 벡터를 특징 수준에서 연결하여 융합한다.
- 융합된 다중모달 특징을 기반으로 정서 예측을 위한 서포트 벡터 머신(SVM) 분류기를 훈련한다.
- 초기 융합과 후기 융합을 포함한 다양한 융합 전략을 체계적으로 비교하여 최적의 구성 식별한다.
- IEMOCAP 다중모달 정서 데이터셋에서 모델을 평가하며, 이는 다중모달 정서 인식의 표준 벤치마크이다.
실험 결과
연구 질문
- RQ1특징 수준 융합과 의사결정 수준 융합 중 어느 전략이 다중모달 정서 인식에서 더 높은 정확도를 낼 수 있는가?
- RQ2미세조정된 사전 훈련된 Transformer 모델은 텍스트, 음성, 비디오에서 정서 관련 특징을 추출하는 데 얼마나 효과적인가?
- RQ3IEMOCAP 데이터셋에서 다중모달 정서 인식을 위한 최적의 특징 융합 방법과 분류기 조합은 무엇인가?
- RQ4개별 모달리티에서 자기지도 학습을 통해 사전 훈련하면 후속 정서 인식 성능 향상에 기여하는가?
주요 결과
- 모달리티별 임bedding의 연결을 통한 특징 수준 융합 전략이 가장 높은 성능을 기록했다.
- 미세조정된 사전 훈련된 Transformer와 SVM 분류기의 조합이 IEMOCAP 데이터셋에서 가장 우수한 결과를 도출했다.
- 제안된 모델은 테스트 정확도 75.42%를 기록하여, 평가된 다른 융합 및 분류 구성보다 뛰어났다.
- 사전 훈련된 Transformer의 미세조정이 모든 모달리티에서 정서 인식을 위한 특징 표현을 크게 향상시켰다.
- 이 연구는 초기 연결 융합과 강력한 분류기(예: SVM)를 활용한 다중모달 융합이 정서 인식에 효과적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.