Skip to main content
QUICK REVIEW

[논문 리뷰] MAE-DFER: Efficient Masked Autoencoder for Self-supervised Dynamic Facial Expression Recognition

Licai Sun, Lian Zheng|arXiv (Cornell University)|2023. 07. 05.
Emotion and Mood Recognition인용 수 7
한 줄 요약

MAE-DFER는 대규모 레이블이 없는 얼굴 영상 데이터를 활용해 효율적인 로컬-글로벌 상호작용 Transformer(LGI-Former) 인코더를 사전학습하는 자기지도 학습 마스킹 오토에인코더 프레임워크를 제안한다. 이는 외관 복원과 시간적 얼굴 운동 모델링을 동시에 수행함으로써 성능을 향상시키며, 여러 벤치마크에서 VideoMAE 대비 약 38% 적은 FLOPs로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Dynamic facial expression recognition (DFER) is essential to the development of intelligent and empathetic machines. Prior efforts in this field mainly fall into supervised learning paradigm, which is severely restricted by the limited labeled data in existing datasets. Inspired by recent unprecedented success of masked autoencoders (e.g., VideoMAE), this paper proposes MAE-DFER, a novel self-supervised method which leverages large-scale self-supervised pre-training on abundant unlabeled data to largely advance the development of DFER. Since the vanilla Vision Transformer (ViT) employed in VideoMAE requires substantial computation during fine-tuning, MAE-DFER develops an efficient local-global interaction Transformer (LGI-Former) as the encoder. Moreover, in addition to the standalone appearance content reconstruction in VideoMAE, MAE-DFER also introduces explicit temporal facial motion modeling to encourage LGI-Former to excavate both static appearance and dynamic motion information. Extensive experiments on six datasets show that MAE-DFER consistently outperforms state-of-the-art supervised methods by significant margins (e.g., +6.30\% UAR on DFEW and +8.34\% UAR on MAFW), verifying that it can learn powerful dynamic facial representations via large-scale self-supervised pre-training. Besides, it has comparable or even better performance than VideoMAE, while largely reducing the computational cost (about 38\% FLOPs). We believe MAE-DFER has paved a new way for the advancement of DFER and can inspire more relevant research in this field and even other related tasks. Codes and models are publicly available at https://github.com/sunlicai/MAE-DFER.

연구 동기 및 목표

  • 감독 학습 기반 DFER에서의 데이터 부족 문제를 대규모 레이블이 없는 얼굴 영상 데이터를 활용해 해결한다.
  • 감독 학습 기반 DFER에 대한 전형적인 비전 트랜스포머의 높은 미세조정 계산 비용 문제를 해결한다.
  • 외관 복원 외에 시간적 얼굴 운동을 명시적으로 모델링하여 표현 학습을 향상시킨다.
  • DFER 전용 사전학습을 위한 VideoMAE보다 더 효율적이고 효과적인 대안을 개발한다.
  • 최소한의 감독 정보로도 실외 및 실험실 환경의 다양한 DFER 데이터셋에서 뛰어난 성능을 달성한다.

제안 방법

  • ViT의 전역 자기주의에 기인한 제곱형 FLOP 비용을 줄이기 위해 효율적인 로컬-글로벌 상호작용 트랜스포머(LGI-Former)를 제안한다.
  • 높은 마스킹 비율(75–90%)을 활용한 마스킹 오토에인코딩 목표를 도입하여 시각적 외관과 시간적 운동 특징을 동시에 복원한다.
  • 프레임 간 차이 맵을 복원하여 시간적 얼굴 운동을 명시적으로 모델링함으로써 동적 표현 학습을 강화한다.
  • 마스킹된 영상 토큰에서 외관 콘텐츠와 운동 패tern을 동시에 복원하기 위해 이중 스트림 재구성 헤드를 도입한다.
  • 하류 DFER 데이터셋에 대한 미세조정 전에 대규모 레이블이 없는 얼굴 영상 데이터(예: VoxCeleb2)를 활용해 모델을 사전학습한다.
  • 경량 디코더를 갖춘 대칭형 인코더-디코더 아키텍처를 활용해 마스킹된 영상 패치를 효율적으로 복원한다.

실험 결과

연구 질문

  • RQ1대규모 레이블이 없는 얼굴 영상 데이터를 활용한 자기지도 사전학습이 감독 학습 방법에 비해 DFER 성능을 크게 향상시키는가?
  • RQ2사전학습 단계에서 시간적 얼굴 운동을 명시적으로 모델링하면 외관 복원만 하는 것보다 더 나은 동적 표정 표현을 얻을 수 있는가?
  • RQ3더 효율적인 트랜스포머 아키텍처가 VideoMAE 대비 성능을 유지하거나 향상시키면서도 미세조정 시 계산 비용을 줄일 수 있는가?
  • RQ4MAE-DFER는 실외 및 실험실 환경을 포함한 다양한 DFER 데이터셋에 대해 얼마나 잘 일반화되는가?
  • RQ5MAE-DFER가 학습한 표현 공간이 감독 및 자기지도 기반 베이스라인에 비해 클래스 간 분리성과 밀도를 얼마나 향상시키는가?

주요 결과

  • DFEW에서 최고의 감독 학습 방법 대비 +6.30% UAR 향상, MAFW에서는 +8.34% UAR 향상하여 강력한 일반화 능력을 입증한다.
  • CREMA-D에서 최고의 감독 학습 방법 대비 UAR 기준 12% 이상 향상되며, DFEW에서는 82.45% UAR 및 80.12% WAR를 기록한다.
  • 모든 데이터셋에서 VideoMAE 대비 약 38% 적은 추론 FLOPs를 기록하면서도 동등하거나 더 뛰어난 성능을 유지한다.
  • t-SNE 시각화 결과, MAE-DFER가 감독 및 VideoMAE 기반 베이스라인보다 더 밀도 있고 분리 가능한 얼굴 표정 임베딩을 학습함을 확인한다.
  • 세 가지 실외 데이터셋(DFEW, FERV39k, MAFW)에서 최신 기술 수준의 성능을 달성하며, CREMA-D 및 RAVDESS에서는 다중모odal 방법을 초월한다.
  • 재구성 결과는 MAE-DFER가 높은 마스킹 비율(75–90%)에서도 얼굴 표정과 운동 패턴을 효과적으로 복원할 수 있음을 보여주며, 강력한 스페아오토로널 추론 능력을 갖추고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.