Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking the Learning Paradigm for Facial Expression Recognition

Weijie Wang, Li, Bo|arXiv (Cornell University)|2022. 09. 30.
Emotion and Mood Recognition인용 수 5
한 줄 요약

이 논문은 주관적인 커뮤니티 기반 코딩으로 인해 애매한 레이블을 가진 실생활 얼굴 표정 인식(Facial Expression Recognition, FER) 데이터셋을 다루기 위해 약한 지도 학습 기반 부분 레이블 학습(Partial Label Learning, PLL) 프레임워크를 제안한다. 자기지도 학습을 통한 특징 표현 학습을 위해 마스킹 이미지 모델링(Masked Image Modeling, MIM)을 사용하고, Transformer 디코더를 활용해 레이블 신뢰도를 쿼리한다. 이는 RAF-DB, FERPlus, AffectNet에서 최신 기술(SOTA) 성능을 달성하며, 완전 지도 학습 기반 SOTA 방법보다 최대 1.16% 높은 정확도를 기록한다.

ABSTRACT

Due to the subjective crowdsourcing annotations and the inherent inter-class similarity of facial expressions, the real-world Facial Expression Recognition (FER) datasets usually exhibit ambiguous annotation. To simplify the learning paradigm, most previous methods convert ambiguous annotation results into precise one-hot annotations and train FER models in an end-to-end supervised manner. In this paper, we rethink the existing training paradigm and propose that it is better to use weakly supervised strategies to train FER models with original ambiguous annotation.

연구 동기 및 목표

  • 주관적인 커뮤니티 기반 코딩과 클래스 간 유사성으로 인해 발생하는 실생활 얼굴 표정 데이터셋의 본질적 애매함을 해결하기 위해.
  • 애매한 레이블을 one-hot 레이블로 변환하는 일반적인 관행이 인위적 노이즈를 유발한다는 점을 도전하기 위해.
  • 원래의 애매한 레이블을 유지하는 새로운 약한 지도 학습 프레임워크인 부분 레이블 학습(Partial Label Learning, PLL)을 제안하기 위해.
  • 자기지도 학습 기반 마스킹 이미지 모델링(Masked Image Modeling, MIM) 사전학습을 활용해 레이블 애매함 상황에서도 표현 학습을 향상시키기 위해.
  • 이미지 특징과의 크로스 어텐션을 통해 각 후보 레이블에 대한 신뢰도 점수를 계산하기 위해 Transformer 디코더 기반의 쿼리 기반 레이블 해석 기법을 개발하기 위해.

제안 방법

  • 각 샘플이 하나의 정답 레이블을 포함하는 후보 레이블 집합을 가진 부분 레이블 학습(Partial Label Learning, PLL) 문제로 FER를 모델링한다.
  • ImageNet-1K 및 FER 전용 데이터에서 마스킹 이미지 모델링(Masked Image Modeling, MIM)을 사용해 비전 트랜스포머 백본을 사전학습하여 강력한 자기지도 학습 기반의 얼굴 표정 표현을 학습한다.
  • 이미지 특징과의 크로스 어텐션을 통해 각 후보 레이블에 대한 신뢰도 점수를 계산하기 위해, 학습 가능한 클래스 임베딩을 쿼리로 사용해 트랜스포머 디코더를 구현한다.
  • 클래스 불균형 문제를 완화하기 위해, 쿼리 임베딩을 초구면 위에 균일하게 분포시키는 데 목적이 있는 레이블 균일 임베딩 정규화 손실($\mathcal{L}_{uniform}$)을 도입한다.
  • 해석 결정의 신뢰도를 평가하여 레이블 예측을 개선하기 위해 수정 신뢰도 모듈을 적용한다.
  • 예측된 레이블 신뢰도에 대해 교차 엔트로피 손실을 최적화하는 방식으로, 전체 모델을 PLL 설정에서 엔드 투 엔드로 미세조정한다.

실험 결과

연구 질문

  • RQ1FER 학습에서 애매한 레이블을 그대로 유지하는 것이 one-hot 레이블로 변환하는 것보다 성능 향상에 기여하는가?
  • RQ2레이블이 애매할 경우 마스킹 이미지 모델링(Masked Image Modeling, MIM)이 강력한 얼굴 표정 표현을 학습하는 데 얼마나 효과적인가?
  • RQ3Transformer 디코더 기반의 레이블 신뢰도 쿼리 메커니즘이 FER의 PLL에서 레이블 해석을 향상시키는 데 기여하는가?
  • RQ4제안된 PLL 프레임워크가 실생활 FER 벤치마크에서 완전 지도 학습 기반 최신 기술(SOTA) 방법을 초월하는가?
  • RQ5레이블 균일 정규화 및 수정 신뢰도 모듈과 같은 보조 모듈이 해석 성능에 기여하는 정도는 어떠한가?

주요 결과

  • 제안된 PLL 기반 방법은 RAF-DB에서 92.05%의 정확도를 기록하여 이전 SOTA(DMUE)보다 0.91% 높은 성능을 달성한다.
  • FERPlus에서 제안 방법은 MIM 사전학습과 PLL을 적용해 SOTA보다 1.16% 높은 90.35%의 정확도를 기록한다.
  • AffectNet에서는 같은 백본을 사용한 기준 모델 대비 0.55% 향상된 67.11%의 정확도를 달성한다.
  • 절단 실험 결과, Transformer 디코더 모듈은 RAF-DB에서 0.94%의 정확도 향상을, AffectNet7에서는 0.55%의 향상을 기여함을 확인했다.
  • MIM 사전학습에서 픽셀 수준 예측 대신 HOG 기반 특징을 사용할 경우, 성능이 향상됨(90.35% 대 90.09%)을 확인하여 HOG가 FER에 더 적합함을 시사한다.
  • MIM 사전학습과 PLL의 조합은 SL 사전학습 대비 0.72%의 정확도 향상을 기록하여, 레이블 애매함 상황에서 자기지도 학습의 이점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.