[논문 리뷰] Mutilmodal Feature Extraction and Attention-based Fusion for Emotion Estimation in Videos
이 논문은 다양한 길이의 영상에서 시각적, 청각적, 자세 특징을 통합하여 영상 기반 정서 추정을 위한 주의 기반 다중모odal 융합 프레임워크를 제안한다. 시간 특징에 교차 주의 메커니즘을 적용하고 주의된 표현을 연결함으로써, 모델은 ABAW 2023 벤치마크에서 검증 F1 스코어 0.361을 달성하여 초기 융합 및 단일 모odal 기반 베이스라인을 능가한다.
The continuous improvement of human-computer interaction technology makes it possible to compute emotions. In this paper, we introduce our submission to the CVPR 2023 Competition on Affective Behavior Analysis in-the-wild (ABAW). Sentiment analysis in human-computer interaction should, as far as possible Start with multiple dimensions, fill in the single imperfect emotion channel, and finally determine the emotion tendency by fitting multiple results. Therefore, We exploited multimodal features extracted from video of different lengths from the competition dataset, including audio, pose and images. Well-informed emotion representations drive us to propose a Attention-based multimodal framework for emotion estimation. Our system achieves the performance of 0.361 on the validation dataset. The code is available at [https://github.com/xkwangcn/ABAW-5th-RT-IAI].
연구 동기 및 목표
- 다양한 모odal—시각적, 청각적, 자세적—을 활용하여 야외 환경에서 정서적 행동 분석의 정확도를 향상시키기 위해.
- 단일 모달 접근 방식의 한계를 보완하기 위해 다양한 데이터 스트림에서 상보적인 정보를 융합하기 위해.
- 다양한 모달 간 관련된 맥락적 특징를 가중치를 부여하는 주의 메커니즘을 통해 정서 동역학의 시간적 모델링을 향상시키기 위해.
- ABAW 2023 야외 환경에서의 정서 행동 분석 챌린지에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- AffectNet에서 사전 훈련된 FAN(Face Alignment Network)을 사용하여 얼굴 특징를 추출하고, Aff-Wild2에서 미세조정하여 얼굴 표현 학습을 향상시켰다.
- 1초 윈도우와 500ms 힙 사이즈를 사용한 DenseNet121을 활용하여 청각 특징를 추출하여 1024차원 임bedding을 생성했다.
- 0.5초 간격으로 OpenPose를 사용하여 2D 자세 좌표를 추출하여 동적 자세 시퀀스를 생성했다.
- 두 층의 RNN을 사용하여 얼굴, 청각, 자세 특징 시퀀스의 시간적 의존성을 각각 모델링했다.
- 현재 프레임의 얼굴 특징를 쿼리로 사용하여 각 모달의 시간적 맥락에 주의를 기울이는 교차 주의 모듈을 구현했다.
- 세 가지 주의된 특징 표현과 현재 얼굴 특징를 연결하고, 표현 예측을 위해 완전히 연결된 신경망을 통과시켰다.
실험 결과
연구 질문
- RQ1비교적 조기 융합 또는 후기 융합 대비 주의 기반 융합을 통한 다중모달 특징(시각적, 청각적, 자세적) 융합이 정서 추정 성능 향상에 기여하는가?
- RQ2다양한 모달에서의 장거리 시간적 맥락 통합이 제한된 영상 환경에서 정서 인식의 강건성을 어떻게 향상시키는가?
- RQ3추론 과정에서 다른 모달의 관련 맥락 정보를 동적으로 가중치를 매기는 교차 주의 메커니즘의 영향은 무엇인가?
- RQ4제안된 프레임워크는 다양한 데이터 분할에 일반화되어 있으며 ABAW 2023 검증 세트에서 높은 성능을 유지하는가?
주요 결과
- 주의 기반 융합 모델은 검증 F1 스코어 0.361을 달성하여 초기 융합(0.318) 및 단일 모달 기반 베이스라인을 모두 능가했다.
- 모델은 제5분할에서 평균 F1 스코어 35.5%를 기록하여 가장 높은 성능를 보였고, 공식 분할에서 전체적으로 최고 성능(33.7%)을 기록했다.
- 주의 융합 전략은 일반적으로 예측이 어려운 클래스인 '분노'(32% F1)와 '놀람'(28% F1)에 있어 성능 향상이著명했다.
- 교차 주의의 사용은 청각, 자세, 시각적 시퀀스에서 관련된 시간적 맥락을 동적으로 주의할 수 있게 하여 특징 표현 품질을 향상시켰다.
- 다섯 개의 랜덤 데이터 분할 전반에서 강력한 일반화 성능를 보였으며, F1 스코어는 30.0%에서 35.5% 사이로 변동했다.
- FAN을 Aff-Wild2에서 미세조정함으로써 얼굴 특징 품질이 향상되어 전체 성능 향상에 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.