Skip to main content
QUICK REVIEW

[논문 리뷰] MARLIN: Masked Autoencoder for facial video Representation LearnINg

Zhixi Cai, Shreya Ghosh|arXiv (Cornell University)|2022. 11. 12.
Face recognition and analysis인용 수 4
한 줄 요약

MARLIN은 웹 크롤링된 비annotated 영상에서 유니버설 얼굴 비디오 표현을 학습하기 위한 자기지도 학습 마스크된 오토인코더를 제안한다. 밀도 높은 얼굴 영역을 마스킹하기 위해 얼굴 부위 가이드 튜브 마스킹 전략(Fasking)을 사용하여 시공간 세부 정보를 복원함으로써, 얼굴 속성 인식에서 1.13% 높은 정확도와 입술 동기화에서 29.36% 향상된 Frechet Inception Distance(FID)를 달성하여 다양한 후행 작업에서 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

This paper proposes a self-supervised approach to learn universal facial representations from videos, that can transfer across a variety of facial analysis tasks such as Facial Attribute Recognition (FAR), Facial Expression Recognition (FER), DeepFake Detection (DFD), and Lip Synchronization (LS). Our proposed framework, named MARLIN, is a facial video masked autoencoder, that learns highly robust and generic facial embeddings from abundantly available non-annotated web crawled facial videos. As a challenging auxiliary task, MARLIN reconstructs the spatio-temporal details of the face from the densely masked facial regions which mainly include eyes, nose, mouth, lips, and skin to capture local and global aspects that in turn help in encoding generic and transferable features. Through a variety of experiments on diverse downstream tasks, we demonstrate MARLIN to be an excellent facial video encoder as well as feature extractor, that performs consistently well across a variety of downstream tasks including FAR (1.13% gain over supervised benchmark), FER (2.64% gain over unsupervised benchmark), DFD (1.86% gain over unsupervised benchmark), LS (29.36% gain for Frechet Inception Distance), and even in low data regime. Our code and models are available at https://github.com/ControlNet/MARLIN .

연구 동기 및 목표

  • 작업 특화 annotation이 필요 없이 다양한 얼굴 분석 작업에 일반화되는 작업에 관계없는 유니버설 얼굴 비디오 인코더를 개발하는 것.
  • 얼굴 분석 분야에서 데이터 부족 및 annotation 비용 문제를 해결하기 위해 풍부한 비annotated 얼굴 영상 자료를 활용해 자기지도 학습 전훈을 수행하는 것.
  • 국소(예: 눈, 입) 및 전반적인 얼굴 운동을 모두 포괄하는 복잡한 복원 작업을 제안함으로써 특징의 전이 가능성 향상.
  • 적대적 학습과 새로운 얼굴 영역 가이드 마스킹 전략(Fasking)을 통해 표현 품질 향상. 기존의 표준 마스킹 방법보다 뛰어난 성능을 기록.
  • 대규모 비정제 영상 데이터에서 강력하고 일반적인 얼굴 특징을 학습함으로써 소수의 샘플 또는 낮은 데이터 환경에서도 효과적인 성능 달성

제안 방법

  • ViT 기반 인코더와 디코더를 사용하여 밀도 높은 얼굴 영역을 마스킹한 상태에서 시공간적 얼굴 비디오 프레임을 복원하는 마스크된 오토인코더 프레임워크(MARLIN)를 제안.
  • FaceXZoo를 활용해 얼굴 랜드마크를 동적으로 추적하고 눈, 코, 입, 입술, 피부 등 주요 얼굴 부위를 마스킹하는 새로운 얼굴 가이드 튜브 마스킹 전략(Fasking)을 도입하여 국소 및 전반적인 얼굴 구조 학습을 유도.
  • 복원 곤란성과 특징 품질의 균형을 위해 약 90%의 마스킹 비율을 사용하며, CMU-MOSEI 및 FF++ 데이터셋에서 경험적으로 검증.
  • 잠재 표현에 대해 적대적 학습을 통합하여 복원 정확도 향상과 학습된 특징의 품질 향상.
  • 기본 인코더로 ViT-B를 사용하며, 성능 및 확장성 비교를 위해 ViT-S, ViT-B, ViT-L의 아블레이션 스터디 수행.
  • 마스크된 오토인코딩 목표를 사용해 YouTube Faces 데이터셋에서 전훈을 수행한 후, 최소한의 레이블 데이터로 후행 작업에서 미세조정
Figure 1 : Overview of the proposed Masked Autoencoder for facial Representation LearnINg aka MARLIN. MARLIN aims to learn a universal facial representation from abundantly available non-annotated facial video data.
Figure 1 : Overview of the proposed Masked Autoencoder for facial Representation LearnINg aka MARLIN. MARLIN aims to learn a universal facial representation from abundantly available non-annotated facial video data.

실험 결과

연구 질문

  • RQ1비정제되고 annotation이 없는 얼굴 영상에서 자기지도 학습 마스크된 오토인코더가 일반적이고 전이 가능한 얼굴 표현을 학습할 수 있는가?
  • RQ2얼굴 부위 가이드 마스킹 전략(Fasking)이 랜덤, 프레임 수준, 또는 표준 튜브 마스킹보다 얼굴 비디오 표현 학습에서 더 나은 특징 학습을 이끌어내는가?
  • RQ3적대적 학습은 얼굴 특징의 복원 품질과 얼굴 분석 작업의 후행 성능을 어떻게 향상시키는가?
  • RQ4MARLIN은 레이블 데이터가 제한된 작업을 포함해 다양한 얼굴 분석 작업에 얼마나 잘 일반화되는가?
  • RQ5얼굴 비디오 마스크된 오토인코딩에서 복원 곤란성과 특징 품질의 균형을 맞추기 위한 최적의 마스킹 비율은 무엇인가?

주요 결과

  • Facial Attribute Recognition(FAR)에서 MARLIN은 감독 기반 벤치마크보다 1.13%의 절대 정확도 향상을 기록하여, 레이블 데이터가 제한된 환경에서도 강력한 전이 가능성 입증.
  • Facial Expression Recognition(FER)에서 MARLIN은 비감독 기반 벤치마크보다 2.64% 향상된 성능 기록하여 감정 민감한 표현 학습의 효과성 입증.
  • DeepFake Detection(DFD)에서 MARLIN은 비감독 기반 베이스라인보다 1.86% 향상된 성능 기록하여 미세한 얼굴 조작 패tern에 대한 강건성 입증.
  • Lip Synchronization(LS)에서 MARLIN은 기존 방법 대비 Frechet Inception Distance(FID)를 29.36% 향상시켜 시공간적 얼굴 운동 생성 품질이 뛰어남.
  • 아블레이션 스터디 결과, Fasking 마스킹 전략이 랜덤, 프레임 수준, 표준 튜브 마스킹보다 뛰어난 성능 기록하며 모든 후행 작업에서 최고 성능 기록.
  • 최적의 마스킹 비율은 경험적으로 약 90%로 확인되었으며, 이는 너무 많은 가시 정보 또는 과도한 복원 곤란성으로 인해 낮거나 높은 비율일 경우 성능 저하됨.
Figure 2 : Architectural overview of MARLIN (Best viewed in color). MARLIN mainly consists of (a) Representation Learning Module, (b) Facial Region guided Tube Masking, and (c) Downstream Adaptation. (a) Representation Learning Module: MARLIN learns the facial representation from the unlabeled, web
Figure 2 : Architectural overview of MARLIN (Best viewed in color). MARLIN mainly consists of (a) Representation Learning Module, (b) Facial Region guided Tube Masking, and (c) Downstream Adaptation. (a) Representation Learning Module: MARLIN learns the facial representation from the unlabeled, web

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.