Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Multi-label Facial Action Unit Detection with Transformer

Lingfeng Wang, Shisen Wang|arXiv (Cornell University)|2022. 03. 24.
Emotion and Mood Recognition인용 수 10
한 줄 요약

이 논문은 시각-청각 트랜스포머 프레임워크를 사용하여 다중 모odal, 다중 레이블 얼굴 동작 단위(AU) 검출 모델을 제안한다. 새로운 트랜스포머 기반 AU 상관관계 모듈을 통해 분류 성능을 향상시킨다. 공간-시간 시각적 특징과 청각적 특징을 함께 모델링하고, AU 간 상관관계를 명시적으로 모델링함으로써, ABAW 2022 검증 세트에서 F1 스코어 0.518을 달성하여 경쟁 기준 모델을 압도적으로 뛰어넘는 성능을 보였다.

ABSTRACT

Facial Action Coding System is an important approach of facial expression analysis.This paper describes our submission to the third Affective Behavior Analysis (ABAW) 2022 competition. We proposed a transfomer based model to detect facial action unit (FAU) in video. To be specific, we firstly trained a multi-modal model to extract both audio and visual feature. After that, we proposed a action units correlation module to learn relationships between each action unit labels and refine action unit detection result. Experimental results on validation dataset shows that our method achieves better performance than baseline model, which verifies that the effectiveness of proposed network.

연구 동기 및 목표

  • 실외 환경에서 다중 레이블 얼굴 동작 단위(AU) 검출 성능을 햖थ기 위해 다중 모달(시각 및 청각) 입력을 활용하고자 한다.
  • 각 AU 레이블 간 불균형 문제를 해결하기 위해 가중치가 부여된 이진 교차 엔트로피 손실을 사용하고자 한다.
  • 매우 상호의존적인 AU 간 상관관계를 모델링하여 성능을 향상시키고자 한다.
  • 공간-시간 특징 추출을 위한 트랜스포머 기반의 통합 시각-청각 표현 학습 프레임워크를 개발하고자 한다.
  • 제안된 상관관계 모듈이 다중 레이블 AU 예측을 정교화하는 데 효과적인지 검증하고자 한다.

제안 방법

  • 공간-시간 트랜스포머(ST-Former)는 얼굴 영역에서 공간-시간 특징을 추출하며, 컨volutional 공간 트랜스포머와 시간 인코더를 조합한다.
  • 별도의 ResNet-18 기반 모델은 청각 멜-스펙트로그램을 처리하여 청각적 특징을 추출한다.
  • AU 상관관계 모듈은 12개의 AU 레이블 간 관계를 12개의 독립된 완전 연결 브랜치에서 유래한 특징을 사용해 트랜스포머 인코더로 모델링한다.
  • 시각 및 청각 브랜치의 특징은 연결되어 상관관계 모듈을 통해 통합 AU 예측을 수행한다.
  • 모델은 각 AU에 대해 양성 샘플 빈도의 역수 비례로 가중치가 부여된 이진 교차 엔트로피 손실을 사용해 훈련된다.
  • 훈련은 단계적으로 진행되며, 먼저 시각 기반 모델을 사전 훈련하고, 이후 청각 및 상관관계 모듈을 함께 미세조정한다.

실험 결과

연구 질문

  • RQ1시각 및 청각 입력을 조합한 다중 모달 트랜스포머 모델이 단일 모달 기준 모델보다 AU 검출 성능을 향상시킬 수 있는가?
  • RQ2트랜스포머 기반 모듈을 통해 AU 간 상관관계를 명시적으로 모델링하면 다중 레이블 AU 검출 정확도가 향상되는가?
  • RQ3제안된 공간-시간 트랜스포머가 얼굴 시퀀스의 장거리 시간적 및 공간적 의존성을 얼마나 잘 포착하는가?
  • RQ4가중치가 부여된 이진 교차 엔트로피 손실이 AU 검출에서의 클래스 불균형 문제를 어느 정도 완화하는가?
  • RQ5각 구성 요소(청각, 시각, 상관관계 모듈)가 Aff-Wild2 검증 세트에서 최종 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 통합 청각-시각 모델은 공식 ABAW 2022 검증 세트에서 F1 스코어 0.518을 달성하여 경쟁 기준 모델(0.39)을 크게 앞서는 성능을 보였다.
  • AU 상관관계 모듈을 적용함으로써, 시각 스트림에선 F1 스코어가 0.21 포인트 향상되었고, 청각 스트림에선 0.22 포인트 향상되었다.
  • 시각 브랜치에 시간 트랜스포머를 사용함으로써, 공간 전용 모델 대비 F1 스코어가 0.21 포인트 향상되었다.
  • 시각 공간-시간 모델만으로도 F1 스코어 0.501을 달성하여, 공간-시간 모델링의 효과성을 입증하였다.
  • 청각 브랜치만으로도 F1 스코어 0.344를 기록하여, 청각 정보가 AU 검출에 의미 있는 기여를 한다는 것을 시사한다.
  • 제거 실험을 통해 각 구성 요소(청각, 시각, 상관관계 모듈)가 최종 성능 향상에 누적적으로 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.