[논문 리뷰] Multi-modal Expression Recognition with Ensemble Method
이 논문은 ABAW 2023 챌린지에 대응하여 앙상블 기반의 다중모달 표현 인식 시스템을 제안한다. 다양한 사전 훈련된 시각적 및 청각적 특징을 시간적 인코더(LSTM 및 Transformer)와 융합하여 정서 인식 성능을 향상시킨다. 전략적 특징 융합 및 모델 앙상블 전략을 통해 검증 세트에서 평균 F1 스코어 0.45774를 달 đạt한다.
This paper presents our submission to the Expression Classification Challenge of the fifth Affective Behavior Analysis in-the-wild (ABAW) Competition. In our method, multimodal feature combinations extracted by several different pre-trained models are applied to capture more effective emotional information. For these combinations of visual and audio modal features, we utilize two temporal encoders to explore the temporal contextual information in the data. In addition, we employ several ensemble strategies for different experimental settings to obtain the most accurate expression recognition results. Our system achieves the average F1 Score of 0.45774 on the validation set.
연구 동기 및 목표
- 다양한 시각적 및 청각적 데이터를 활용하여 야외 환경에서의 정서적 행동 분석을 향상시키기 위해 다중모달 데이터 기반의 더 견고한 표현 인식을 구현한다.
- 단모달 모델의 한계를 보완하기 위해 상호보완적인 시각적 및 청각적 특징을 융합하여 모델의 일반화 능력과 내구성을 향상시킨다.
- 다양한 사전 훈련된 모델에서 유도된 시각적 및 청각적 모odal의 특징 조합을 효과적으로 탐색한다.
- LSTM 및 Transformer 아키텍처를 활용하여 순차적인 정서적 동역학의 시간적 모델링을 최적화한다.
- 다양한 아키텍처와 특징 세트를 기반으로 체계적인 모델 앙상블 전략을 통해 최종 예측 성능을 향상시킨다.
제안 방법
- 면역체크를 통해 얼굴 영상을 추출하고, 결손 프레임이 있는 경우 시간적 보간을 적용하여 정렬한다.
- 다양한 사전 훈련된 모델을 활용해 다중모달 특징을 추출한다: 시각적 특징은 DenseNet, IResNet100, MobileNet, MAE를 활용하고, 청각적 특징은 eGeMAPS, ComParE 2016, VGGish, Wav2Vec 2.0, ECAPA-TDNN, HuBERT를 활용한다.
- 다양한 사전 훈련된 모델에서 유도된 시각적 및 청각적 특징 임베딩을 연결하여 다중모달 특징 표현을 구성한다.
- 결합된 다중모달 특징에 대해 LSTM 및 Transformer 두 가지 시간적 인코더를 적용하여 순차적 맥락과 시간적 의존성을 모델링한다.
- Adam 옵timizer를 사용하여 25 에포크 스케줄로 모델을 훈련시키며, 드롭아웃(0.3), 어텐션 헤드 수(4), 시퀀스 길이(128) 등의 하이퍼파라미터를 조정한다.
- 다양한 아키텍처와 특징 조합을 가진 모델 간의 투표 전략을 포함한 앙상블 전략을 적용하여 최종 예측 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1다양한 사전 훈련된 시각적 및 청각적 특징 조합이 표현 인식 성능에 미치는 영향은 어떠한가?
- RQ2LSTM과 Transformer 아키텍처 중 어느 것이 얼굴 및 청각적 표현의 시간적 동역학을 더 효과적으로 모델링하는가?
- RQ3모델 앙상블 전략이 다중모달 표현 인식에서 정확성과 내구성에 얼마나 기여하는가?
- RQ4자기지도 학습 기반 시각적 특징(MAE 등)과 지도 학습 기반 모델(IResNet100 등) 간의 성능 비교는 어떠한가?
- RQ5수작업 특징(e.g., ecapatdnn, fbank)과 딥 러닝 기반 청각적 특징 간의 기여도는 다중모달 정서 인식에서 어떻게 다를까?
주요 결과
- 다양한 아키텍처와 특징 조합을 가진 다수의 모델 앙상블이 검증 세트에서 가장 높은 F1 스코어 0.45774를 달달했다.
- 가장 높은 성능을 보인 개별 모델(LSTM, densenet, mae, ires100, ecapatdnn, hubert)은 F1 스코어 0.41410을 기록했다.
- Transformer 기반 모델(MAE, IResNet100, DenseNet, ecapatdnn, Hubert 특징 사용)은 F1 스코어 0.39380를 달성했다.
- 절단 분석 결과, MAE, IResNet100, DenseNet 시각적 특징과 ecapatdnn, Hubert 청각적 특징을 융합한 조합이 가장 높은 F1 스코어(0.39380)를 기록했다.
- 수작업 특징(e.g., ecapatdnn, fbank)을 포함한 구성에서는 딥 러닝 기반 청각적 특징만 사용한 경우보다 성능 향상이 관찰되었다.
- 모델 앙상블 전략은 개별 모델을 압도적으로 뛰어넘었으며, 아키텍처 및 특징 선택의 다양성의 가치를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.