[논문 리뷰] Investigation of Multimodal Features, Classifiers and Fusion Methods for Emotion Recognition
이 논문은 EmotiW 2018 챌린지에 대비해 음성, 영상, 텍스트 모odal을 수작업 특징과 딥 네트워크(DNN)에서 추출한 봉쇄 특징을 활용해 통합하는 다중모달 정서 인식 시스템을 제안한다. 시간적 및 비시간적 분류기 모두를 평가하고, 다중모달 통합을 위해 Beam Search Fusion(비-퓨전)을 적용하여 테스트 세트에서 60.34%의 정확도를 달성했으며, 우승자와 겨우 1.5% 미만의 정확도 차이를 보이며 강력한 융합 전략을 통해 뛰어난 경쟁력을 입증한다.
Automatic emotion recognition is a challenging task. In this paper, we present our effort for the audio-video based sub-challenge of the Emotion Recognition in the Wild (EmotiW) 2018 challenge, which requires participants to assign a single emotion label to the video clip from the six universal emotions (Anger, Disgust, Fear, Happiness, Sad and Surprise) and Neutral. The proposed multimodal emotion recognition system takes audio, video and text information into account. Except for handcraft features, we also extract bottleneck features from deep neutral networks (DNNs) via transfer learning. Both temporal classifiers and non-temporal classifiers are evaluated to obtain the best unimodal emotion classification result. Then possibilities are extracted and passed into the Beam Search Fusion (BS-Fusion). We test our method in the EmotiW 2018 challenge and we gain promising results. Compared with the baseline system, there is a significant improvement. We achieve 60.34% accuracy on the testing dataset, which is only 1.5% lower than the winner. It shows that our method is very competitive.
연구 동기 및 목표
- EmotiW 2018 챌린지에 대응해, 영상 클립을 여섯 가지 보편적 정서 또는 중립 중 하나로 분류하는 강력한 다중모달 정서 인식 시스템을 개발한다.
- 음성, 영상, 텍스트 모달에서 수작업 특징과 딥 러닝 기반 특징(봉쇄 특징)을 융합하는 효과성을 조사한다.
- 융합 이전에 개별 모달의 성능을 최적화하기 위해 시간적 및 비시간적 분류기를 평가하여 단모달 정서 인식 성능을 최적화한다.
- 특히 Beam Search Fusion(비-퓨전)을 포함한 융합 전략을 탐색하여 다중모달 예측을 효과적으로 통합하고 전체 분류 정확도를 향상시킨다.
제안 방법
- 음성(예: 프로소직 특징), 영상(예: 얼굴 랜드마크 및 액션 유닛), 텍스트(예: 정서 및 감정 어휘 사전)에서 수작업 특징을 추출한다.
- 전이 학습을 통해 사전 훈련된 딥 네트워크(DNN)에서 봉쇄 특징을 추출하여 각 모달의 고수준 표현을 캡처한다.
- 개별 모달 분류기의 최적 성능를 도출하기 위해 시간적 분류기(예: RNN 또는 LSTM)와 비시간적 분류기(예: SVM 또는 MLP)를 모두 평가한다.
- 개별 단모달 분류기의 예측을 Beam Search Fusion(비-퓨전)을 통해 융합한다. 이는 최고의 신뢰도를 가진 통합 예측을 찾기 위해 다양한 융합 경로를 탐색하는 순차적 디코딩 전략이다.
- 융합 과정은 각 모달 간의 신뢰도와 다양성을 균형 있게 조정하여 최종 분류의 강건성을 향상시킨다.
- 최종 시스템은 EmotiW 2018 데이터셋을 기반으로 훈련 및 평가되며, 이는 7개의 정서 레이블 중 하나로 레이블링된 짧은 영상 클립을 포함한다.
실험 결과
연구 질문
- RQ1수작업 특징과 딥 러닝 기반 봉쇄 특징 간의 성능를 음성, 영상, 텍스트 모달 전반에서 단모달 정서 인식에 대해 비교하면 어떻게 되는가?
- RQ2시간적 분류기와 비시간적 분류기 중 어느 것이 영상 클립의 정서 인식에서 더 높은 단모달 성능를 제공하는가?
- RQ3Beam Search Fusion는 간단한 조기 또는 후기 융합 전략에 비해 다중모달 정서 인식 정확도를 얼마나 향상시키는가?
- RQ4다양한 조합의 음성, 영상, 텍스트 특징이 다중모달 환경에서 최종 분류 성능에 어떻게 기여하는가?
- RQ5DNN 봉쇄 특징을 통한 전이 학습이 EmotiW 2018 챌린지에서 전체 시스템 정확도에 어떤 영향을 미치는가?
주요 결과
- 제안된 다중모달 시스템은 EmotiW 2018 테스트 세트에서 60.34%의 정확도를 달성하여 경쟁력 있는 성능를 입증했다.
- DNN 봉쇄 특징의 사용은 수작업 특징만을 사용하는 것보다 단모달 성능를 크게 향상시켰으며, 특히 음성 및 영상 모달에서 두드러진 효과를 보였다.
- Beam Search Fusion(비-퓨전)은 단순한 조기 또는 후기 융합 전략보다 우수한 성능를 보였으며, 다양한 예측 경로를 효과적으로 탐색하고 최종 결정의 신뢰도를 향상시켰다.
- 시간적 분류기는 비시간적 분류기보다 영상 및 음성 모달에서 뛰어난 성능를 보였으며, 정서 인식에서 순차적 동적 특성을 모델링하는 것이 중요함을 시사한다.
- 시스템의 성능는 우승자와 겨우 1.5% 미만의 정확도 차이를 보였으며, 최상위 등수는 아니었지만 뛰어난 경쟁력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.