[논문 리뷰] A Multi-modal and Multi-task Learning Method for Action Unit and Expression Recognition
이 논문은 시각적 및 청각적 입력을 모두 사용하여 얼굴의 동작 단위(AU)와 표정을 동시에 인식하는 다중 모odal, 다중 작업 학습 프레임워크를 제안한다. 공유된 시각적 기반 모델을 AU 및 표정 헤드와 함께 훈련한 후 동결하고, 트랜스포머 인코더를 통해 시각적 및 청각적 특징을 융합함으로써, Aff-Wild2 검증 세트에서 AU 인식 점수 0.712와 표정 인식 점수 0.477를 기록하여 기준 모델보다 유의하게 뛰어난 성능을 달성한다.
Analyzing human affect is vital for human-computer interaction systems. Most methods are developed in restricted scenarios which are not practical for in-the-wild settings. The Affective Behavior Analysis in-the-wild (ABAW) 2021 Contest provides a benchmark for this in-the-wild problem. In this paper, we introduce a multi-modal and multi-task learning method by using both visual and audio information. We use both AU and expression annotations to train the model and apply a sequence model to further extract associations between video frames. We achieve an AU score of 0.712 and an expression score of 0.477 on the validation set. These results demonstrate the effectiveness of our approach in improving model performance.
연구 동기 및 목표
- 데이터가 노이즈가 많고 불균형한 실생활, 인-더-월드 영상 환경에서 정서 인식의 과제를 해결하기 위해.
- 시각적 및 청각적 모odal을 활용하여 행동 단위(AU) 및 얼굴 표정 인식 성능을 향상시키기 위해.
- 작업별 손실 함수와 다중 작업 훈련을 통해 AU 및 표정 데이터셋의 클래스 불균형을 완화하기 위해.
- 장기적인 프레임 간 종속성을 고려한 트랜스포머 기반 인코더를 사용하여 얼굴 시퀀스의 시간적 모델링을 향상시키기 위해.
- AU 및 표정 검증 세트 간 데이터 泄漏를 방지하여 공정한 평가를 보장하기 위해.
제안 방법
- Glint360K에서 Cosface 손실를 사용하여 다중 작업 시각적 기반 모델을 훈련시켜 강력한 얼굴 특징를 추출하고, AU 및 표정 헤드에 공유된 가중치를 사용한다.
- AU 인식은 양성 샘플의 불균형을 다루기 위해 클래스 가중치가 적용된 BCE 손실를 사용하고, 표정 인식은 어려운 예측 예를 강조하기 위해 포칼 손실를 사용한다.
- 시각 모델을 사전 훈련 후 동결하고, Mel-spectrogram 기반의 TDNN 기반 모델을 사용하여 청각 특징를 추출하는 청각 스트림을 추가한다.
- 시각적 및 청각적 특징를 연결하여 단일 레이어 트랜스포머 인코더에 입력하여 영상 프레임 간의 시간적 동역학을 모델링한다.
- Aff-Wild2 데이터셋의 불완전한 주석을 처리하기 위해 AU 및 표정 헤드 간에 교차로 역전파를 수행하는 방식으로 훈련을 반복한다(에포크 또는 배치 단위).
- 최종 예측 헤드는 프레임별 AU 및 표정 확률를 출력하는 완전 연결층이다.
실험 결과
연구 질문
- RQ1AU와 표정의 공동 다중 작업 학습이 인-더-월드 정서 인식 성능을 향상시킬 수 있는가?
- RQ2청각 모달을 통합함으로써 시각적 단서만을 사용할 때보다 AU 및 표정 인식 성능이 향상되는가?
- RQ3트랜스포머 기반의 시퀀스 모델이 정서 인식을 위한 얼굴 시퀀스의 시간적 종속성을 얼마나 효과적으로 포착하는가?
- RQ4BCE 및 포칼 손실를 각각 사용함으로써 AU 및 표정 데이터셋의 클래스 불균형을 어느 정도 완화할 수 있는가?
- RQ5다중 모달, 다중 작업 프레임워크가 실생활 영상 환경에서 과적합을 줄이고 일반화 성능을 향상시킬 수 있는가?
주요 결과
- 제안된 방법은 Aff-Wild2 검증 세트에서 AU 인식 점수 0.712를 기록하여 기준 점수 0.31보다 유의미하게 뛰어나다.
- 표정 인식의 경우, 기준 점수 0.366 대비 0.477의 점수를 기록하여 상당한 향상이 이루어졌다.
- 시각적 및 청각적 모달을 모두 사용함으로써, 특히 도전적인 인-더-월드 조건에서 시각 데이터만을 사용할 때보다 더 뛰어난 성능을 달성한다.
- 교대로 역전파를 수행하는 다중 작업 훈련 전략은 AU 및 표정 데이터셋의 불완전한 주석을 효과적으로 처리한다.
- 트랜스포머 인코더는 장기적인 시간적 종속성을 효과적으로 모델링하여 시퀀스 수준의 인식 정확도를 향상시킨다.
- 중복된 검증 샘플을 제거하여 데이터 泄漏를 제거한 아블레이션 분석을 통해 모델 성능 평가가 공정하고 신뢰할 수 있게 보장되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.