Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Emotion Estimation for in-the-wild Videos

Liyu Meng, Yuchen Liu|arXiv (Cornell University)|2022. 03. 24.
Emotion and Mood Recognition인용 수 13
한 줄 요약

이 논문은 시각적 및 청각적 특징을 활용하고 시간적 인코더(LSTM 및 Transformer)와 후처리 스무딩을 적용하여 실외 환경의 영상에서 정서의 평가 및 각성도 추정을 위한 다중모달 딥러닝 접근법을 제안한다. 제안된 방법은 Aff-Wild2 검증 세트에서 평가에 대해 65.55% CCC, 각성도에 대해 70.88% CCC를 기록하여 실생활 정서 컴퓨팅에서 다중모달 융합 및 모델 앙상블의 효과를 입증한다.

ABSTRACT

In this paper, we briefly introduce our submission to the Valence-Arousal Estimation Challenge of the 3rd Affective Behavior Analysis in-the-wild (ABAW) competition. Our method utilizes the multi-modal information, i.e., the visual and audio information, and employs a temporal encoder to model the temporal context in the videos. Besides, a smooth processor is applied to get more reasonable predictions, and a model ensemble strategy is used to improve the performance of our proposed method. The experiment results show that our method achieves 65.55% ccc for valence and 70.88% ccc for arousal on the validation set of the Aff-Wild2 dataset, which prove the effectiveness of our proposed method.

연구 동기 및 목표

  • 감정 표현이 미묘하고 다양성이 있는 실생활 비디오 환경에서의 평가 및 각성도 추정 향상.
  • 단일모달 접근법의 한계를 보완하기 위해 시각적 및 청각적 모달을 융합하여 상보적인 정서적 단서를 포착.
  • 순환 및 자기주의 주의 메커니즘을 사용하여 영상 시퀀스의 시간적 동적 특성을 모델링하여 개선된 순차적 정서 예측 달성.
  • 후처리 스무딩 및 모델 앙상블 전략을 통해 예측의 강인성 향상.

제안 방법

  • 영상은 얼굴 이미지 프레임으로 처리되고, 시각적 특징은 IResNet100, DenseNet 및 FAU 모델을 사용해 추출된다.
  • 청각적 특징은 ComParE, VGGish, eGeMAPs 및 wav2vec 모델을 사용해 추출되어, 프로소직 및 스펙트럼적 정서적 단서를 포착한다.
  • 시각적 및 청각적 스트림에서 유도된 다중모달 특징은 LSTM 또는 Transformer 아키텍처를 사용한 시간적 인코더에 입력되어 순차적 맥락을 모델링한다.
  • 두 층으로 구성된 완전 연결 회귀 헤드는 인코딩된 표현에서 프레임별 평가 및 각성도 점수를 예측한다.
  • 후처리 단계에서 평가에 대해 20프레임 윈도우, 각성도에 대해 50프레임 윈도우를 사용한 시간적 스무딩을 적용하여 예측 노이즈를 감소시킨다.
  • 모델 앙상블 전략은 다양한 아키텍처, 하이퍼파라미터 및 특징 세트를 가진 여러 모델의 예측을 결합하여 일반화 능력과 성능 향상에 기여한다.

실험 결과

연구 질문

  • RQ1비구속적인 영상에서 시각적 및 청각적 특징의 다중모달 융합이 평가 및 각성도 추정에 얼마나 효과적인가?
  • RQ2다양한 시각적 및 청각적 특징 추출기들이 정서 인식 성능에 기여하는 상대적 기여도는 어떠한가?
  • RQ3LSTM 및 Transformer 기반 시간적 인코더는 영상 데이터의 순차적 정서적 동적 특성을 어떻게 비교하여 모델링하는가?
  • RQ4후처리 스무딩 및 모델 앙상블 전략이 예측의 안정성과 정확도 향상에 얼마나 기여하는가?
  • RQ5특징 조합과 아키텍처 조합 중에서 Aff-Wild2 벤치마크에서 가장 높은 성능을 내는 조합은 무엇인가?

주요 결과

  • 제안된 방법은 Aff-Wild2 검증 세트에서 평가에 대해 65.55% CCC, 각성도에 대해 70.88% CCC를 기록하여 뛰어난 성능을 입증한다.
  • TRM-v2 기반의 Transformer 모델이 각성도 예측 성능을 가장 높게 기록(0.7088 CCC)하였고, TRM-v1은 특정 특징 조합에서 평가 예측에 가장 뛰어난 성능(0.6089 CCC)을 보였다.
  • 모델 앙상블 전략은 성능을 크게 향상시켰으며, 각성도의 경우 최고 단일 모델의 CCC 0.6628에서 0.7088로, 평가의 경우 0.6113에서 0.6555로 향상되었다.
  • ComParE 및 wav2vec에서 유도된 청각적 특징이 평가 예측에 가장 기여했고, VGGish 및 wav2vec는 각성도 예측에 가장 영향을 미쳤다.
  • DenseNet 및 FAU에서 유도된 시각적 특징은 IResNet100보다 평가 예측에서 뛰어난 성능을 보였으며, FAU와 DenseNet의 조합은 개별 모델보다 성능 향상을 이뤘다.
  • 최적화된 윈도우 크기(평가에 20프레임, 각성도에 50프레임)를 사용한 시간적 스무딩은 더 안정적이고 현실적인 예측 곡선을 도출하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.