[논문 리뷰] Interpretable Multimodal Emotion Recognition using Facial Features and Physiological Signals
이 논문은 비디오 입력에서 rPPG 신호와 얼굴 특징을 조기에 및 늦게 융합하는 전략을 사용하여 해석 가능한 다모odal 정서 인식 프레임워크를 제안한다. 순열 특징 중요도(PFI)를 적용하여 모odal의 기여도를 정량화하였으며, IEMOCAP 데이터셋에서 54.61%의 정확도를 달성하였으며, 시각적 특징이 분류 성능에 62.33% 기여하고 rPPG가 37.67% 기여하였다.
This paper aims to demonstrate the importance and feasibility of fusing multimodal information for emotion recognition. It introduces a multimodal framework for emotion understanding by fusing the information from visual facial features and rPPG signals extracted from the input videos. An interpretability technique based on permutation feature importance analysis has also been implemented to compute the contributions of rPPG and visual modalities toward classifying a given input video into a particular emotion class. The experiments on IEMOCAP dataset demonstrate that the emotion classification performance improves by combining the complementary information from multiple modalities.
연구 동기 및 목표
- 비침습적 생리적 신호(rPPG)와 시각적 신호(얼굴)를 융합하여 정서 분류 성능을 향상시키는 다모달 정서 인식 시스템을 개발한다.
- 다모달 AI 모델의 해석 불가능성 문제를 해결하기 위해 각 모달의 기여도를 정량화하는 PFI 기반 방법을 도입한다.
- 동적 rPPG 신호와 정적 얼굴 특징을 융합하기 위해 조기 융합 및 늦게 융합 전략의 효과를 평가한다.
- 다양한 정서 상태를 보다 정교하게 포착할 수 있음을 입증하기 위해, 다모달 융합이 단모달 접근보다 성능 향상을 이룬다는 것을 보여준다.
- 정서 컴퓨팅 응용 분야에서 실생활에 적합한 투명하고 해석 가능한 AI 출력을 제공한다.
제안 방법
- rPPG 신호는 얼굴 영역을 검출하기 위해 Haar 캐스케이드를 사용하고, 식별된 영역 내 평균 RGB 강도를 계산함으로써 영상 프레임에서 추출되며, 식별된 식별식 (1)에 따라 정의된다.
- 얼굴 특징은 Face Scrub 데이터셋으로 훈련된 Dlib의 68점 랜드마크 검출기로 추출되어 공간적 얼굴 구조를 포착한다.
- 두 개의 별도 딥러닝 모델을 훈련한다: 하나는 rPPG 신호를 위한 ReLU 활성화 함수를 사용한 CNN이며, 另 하나는 ResNet-34 기반 아키텍처를 사용한 얼굴 특징 모델이다.
- 조기 융합은 분류 전에 원시 rPPG 및 얼굴 특징 임베딩을 융합하는 방식이며, 늦게 융합은 각 모달을 별도로 처리한 후 예측 결과를 통합하는 방식이다.
- 모달 기여도를 추정하기 위해 순열 특징 중요도(PFI)를 적용하며, 특징 값이 무작위로 섞였을 때 모델 성능 저하를 측정한다.
- 각 모달의 PFI 점수는 원본 및 무작위 섞인 특징 세트 간의 기대 모델 점수 차이로 계산되며, 식별된 식 (5)에 의해 정의된다.

실험 결과
연구 질문
- RQ1조기 융합과 늦게 융합 전략 간의 정서 인식 정확도에서 rPPG와 얼굴 특징의 융합 방식은 어떻게 비교되는가?
- RQ2rPPG 신호와 얼굴 특징이 최종 정서 분류 결정에 기여하는 상대적 기여도는 얼마인가?
- RQ3순열 특징 중요도가 다모달 입력의 해석 가능성을 정량화하는 데 효과적으로 작용하는가?
- RQ4IEMOCAP 데이터셋에서 다모달 융합이 단모달 모델보다 성능 향상을 유의미하게 개선하는가?
- RQ5실생활의 다양한 정서 표현을 포함한 영상 데이터에 적용했을 때 제안된 프레임워크의 정교함은 어느 정도인가?
주요 결과
- 조기 융합 모델은 IEMOCAP 데이터셋에서 최고의 정서 분류 정확도 54.61%를 기록하였으며, 개별 모달 모델보다 뛰어난 성능을 보였다.
- 순열 특징 중요도로 측정한 결과, rPPG 모달이 최종 분류 성능에 37.67% 기여하였고, 얼굴 특징이 62.33% 기여하였다.
- 개별 rPPG 모델은 37.45%의 정확도를 달성하였고, 얼굴 특징 모델은 46.42%의 정확도를 기록하여, 시각적 신호가 더 강력한 분류 능력을 지닌 것으로 나타났다.
- 늦게 융합은 조기 융합보다 낮은 성능(41.17% 정확도)을 보였으며, 이는 조기 통합이 더 나은 교차 모달 표현 학습을 가능하게 한다는 것을 시사한다.
- 조기 융합 모델의 F1 점수는 0.57이었으며, 이는 다양한 정서 클래스 간 정밀도와 재현율 사이의 균형 잡힌 균형을 반영한다.
- 결과는 보완적인 모달을 융합함으로써 다모달 정서 인식 시스템의 정교함과 정확도가 향상됨을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.