Skip to main content
QUICK REVIEW

[논문 리뷰] CLIPER: A Unified Vision-Language Framework for In-the-Wild Facial Expression Recognition

Hanting Li, Hongjing Niu|arXiv (Cornell University)|2023. 03. 01.
Emotion and Mood Recognition인용 수 4
한 줄 요약

CLIPER는 CLIP의 대비 학습 기반 사전 훈련을 활용하고, 각 표정에 대해 미세하게 구분되고 해석 가능한 텍스트 프롬프트를 학습하기 위해 다중 표정 텍스트 기술자(METD)를 도입함으로써 실외 환경에서의 표정 인식(FER)을 위한 통합된 시각-언어 프레임워크를 제안한다. 실생활에서의 표정 다양성을 반영하는 다양한 의미적 풍부한 텍스트 기술자를 자동으로 생성함으로써 다섯 개인 실외 FER 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Facial expression recognition (FER) is an essential task for understanding human behaviors. As one of the most informative behaviors of humans, facial expressions are often compound and variable, which is manifested by the fact that different people may express the same expression in very different ways. However, most FER methods still use one-hot or soft labels as the supervision, which lack sufficient semantic descriptions of facial expressions and are less interpretable. Recently, contrastive vision-language pre-training (VLP) models (e.g., CLIP) use text as supervision and have injected new vitality into various computer vision tasks, benefiting from the rich semantics in text. Therefore, in this work, we propose CLIPER, a unified framework for both static and dynamic facial Expression Recognition based on CLIP. Besides, we introduce multiple expression text descriptors (METD) to learn fine-grained expression representations that make CLIPER more interpretable. We conduct extensive experiments on several popular FER benchmarks and achieve state-of-the-art performance, which demonstrates the effectiveness of CLIPER.

연구 동기 및 목표

  • 기존 FER 방법이 one-hot 또는 소프트 레이블에 의존함에 따라 의미적 해석 가능성의 부족 문제를 해결하기 위해.
  • 표현 카테고리가 추상적이고 변동성이 큰 실외 FER 환경에서 표준 CLIP의 한계를 극복하기 위해 시각-언어 사전 훈련을 추상적이고 복합적인 표정 카테고리에 적응시키기 위해.
  • 제약 조건이 없는 환경에서 정적 및 동적 표정 인식에 모두 적용 가능한 통합 프레임워크를 개발하기 위해.
  • 수동적인 프롬프트 엔지니어링을 피하기 위해 각 표정 클래스에 대해 다양하고 미세한 텍스트 기술자를 자동으로 학습하기 위해.
  • 표정의 미세한 변동(예: '조금 기쁨' 대비 '매우 기쁨')을 반영하는 텍스트 임베딩을 학습함으로써 모델의 설명 가능성 향상

제안 방법

  • 표현 레이블 대신 텍스트를 감독으로 사용하여 CLIP의 대비 시각-언어 사전 훈련을 표정 인식에 적응시킴.
  • 다중 표정 텍스트 기술자(METD)를 도입함. 각 표정 클래스는 두 단계 훈련 과정을 통해 학습된 K개의 별개의 텍스트 임베딩(K=5)과 연관됨.
  • 각 METD 토큰은 이미지 특징과 동일한 표현과 정렬되도록 최적화되는 학습 가능한 연속적 텍스트 임베딩이며, 대비 손실을 사용함.
  • 동적 FER에서는 시간 평균 풀링을 사용하여 프레임 수준의 특징을 집계함으로써 복잡한 시간 모델링을 회피함.
  • 두 단계 훈련 파라다임을 활용함: 첫 번째 단계에서는 CLIP의 사전 훈련된 시각 인코더를 사용해 이미지 인코더를 미세 조정함; 두 번째 단계에서는 이미지-텍스트 정렬을 위한 대비 손실을 사용해 METD 임베딩을 훈련함.
  • CLIP의 사전 훈련된 텍스트 인코더를 사용해 METD의 학습을 초기화하고 안내함으로써 자연어와의 의미적 일관성 확보

실험 결과

연구 질문

  • RQ1표현 카테고리가 추상적이고 변동성이 큰 실외 환경에서, 대비 시각-언어 사전 훈련이 효과적으로 적용될 수 있는가?
  • RQ2수동적인 프롬프트 엔지니어링에 의존하지 않고, 의미적으로 풍부하고 다양한 텍스트 기술자를 자동으로 생성할 수 있는가?
  • RQ3각 표정 클래스에 대해 다수의 텍스트 기술자를 사용할 경우, 단일 프롬프트보다 성능 향상과 설명 가능성 향상에 기여하는가?
  • RQ4METD는 강도나 표현 양식(예: 미소 vs. 웃음)과 같은 표현의 미세한 변동을 어느 정도 잘 포착하는가?
  • RQ5CLIPER는 제약 조건이 없는 환경에서 정적 및 동적 FER 벤치마크에서 기존 최신 기술 수준(SOTA) 방법을 모두 능가하는가?

주요 결과

  • CLIPER는 RAF-DB, AffectNet, FER2013를 포함한 다섯 개의 실외 FER 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며 이전의 SOTA 방법을 능가함.
  • METD를 통해 더 강력하고 의미적으로 다양한 텍스트 기술자를 학습함으로써 FER 데이터셋에서 제로샷 일반화 능력이 크게 향상됨.
  • 시각화 결과는 METD가 직접적인 표현 관련 단어(예: '슬프다'에 대한 '가장 슬픈')뿐 아니라 의미적으로 관련된 개념(예: '좀비'에 대한 놀라움)까지 학습하고 있음을 보여주며, 이는 설명 가능성의 증거로 작용함.
  • 이 방법은 표정의 미세한 서브클래스를 성공적으로 학습함: 예를 들어 RAF-DB에서 HA₁과 HA₃는 '기쁨'의 미세한 강도 차이(미소 vs. 웃음)를 반영함.
  • 복잡한 시간 모델링 없이도 시간 평균 풀링만을 사용함에도 불구하고 CLIPER는 DFER에서 뛰어난 성능을 기록함으로써 강력한 특징 표현 능력을 보임.
  • 학습된 METD 토큰에 가장 가까운 단어들의 전체 목록은 모델이 표현의 다양한 의미적 형태를 잘 포착하고 있음을 확인함: 예를 들어 분노에 대해선 '울부짖는', 기쁨에 대해선 '친절함' 등을 포착함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.