Skip to main content
QUICK REVIEW

[논문 리뷰] Facial Motion Prior Networks for Facial Expression Recognition

Yuedong Chen, Jianfeng Wang|arXiv (Cornell University)|2019. 02. 23.
Emotion and Mood Recognition참고 문헌 25인용 수 9
한 줄 요약

이 논문은 도메인 지식을 기반으로 한 평균 중성 표정과 표현적 표정 간의 차이를 활용해 얼굴 근육 운동 영역을 강조하는 동작 마스크 생성기를 갖춘 새로운 딥러닝 프레임워크인 Facial Motion Prior Networks (FMPN)를 제안한다. 이 방법은 CK+, MMI, AffectNet 데이터셋에서 최고 성능을 기록하며, 특징 학습 과정에 사전 지식을 효과적으로 통합한다.

ABSTRACT

Deep learning based facial expression recognition (FER) has received a lot of attention in the past few years. Most of the existing deep learning based FER methods do not consider domain knowledge well, which thereby fail to extract representative features. In this work, we propose a novel FER framework, named Facial Motion Prior Networks (FMPN). Particularly, we introduce an addition branch to generate a facial mask so as to focus on facial muscle moving regions. To guide the facial mask learning, we propose to incorporate prior domain knowledge by using the average differences between neutral faces and the corresponding expressive faces as the training guidance. Extensive experiments on three facial expression benchmark datasets demonstrate the effectiveness of the proposed method, compared with the state-of-the-art approaches.

연구 동기 및 목표

  • 기존 딥러닝 방법이 도메인 지식을 효과적으로 통합하지 못하는 한계를 해결하기 위해.
  • 얼굴 랜드마크, 옵티컬 플로우, AU 애너테이션과 같은 보조 데이터에 의존하는 문제를 해결하기 위해, 이는 종종 이용 가능하지 않거나 확보하기 어려운 경우가 있다.
  • GAN 기반의 탈표현 방법에서 반드시 필요한 중성 표면과 표현적 표면의 쌍이 존재하는 조건을 제거하기 위해.
  • 학습된 동작 마스크를 사용해 얼굴 근육 운동 영역에 집중함으로써 특징의 구분 능력을 향상시키는 엔드 투 엔드로 트레이닝 가능한 FER 프레임워크를 개발하기 위해.
  • 얼굴 운동 사전 지식이 다양한 데이터셋, 특히 중성 표면이 확보되지 않은 실외 환경에서도 이식 가능함을 입증하기 위해.

제안 방법

  • 프레임워크는 세 가지 구성 요소로 이루어져 있다: Facial-Motion Mask Generator (FMG), Prior Fusion Net (PFN), Classification Net (CN).
  • FMG는 회색조 표현적 표면을 입력으로 받아 얼굴 근육 운동 영역을 강조하는 공간 마스크를 생성한다.
  • 마스크 생성은 중성 표면과 해당 표현적 표면 간 평균 차이에서 유도된 가짜 지도 마스크를 기반으로 한다.
  • PFN은 원본 입력 이미지와 생성된 동작 마스크를 융합하여 도메인 특화 지식을 특징 학습 과정에 통합한다.
  • CN은 VGG나 ResNet와 같은 구조로, 융합된 표현에서 고수준 특징을 추출하여 최종 표정 분류를 수행한다.
  • 전체 모델은 마스크 생성기용 손실($l_G$)과 분류 헤드용 손실($l_C$) 두 가지 손실 함수를 사용해 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1얼굴 근육 운동에 대한 도메인 지식을 통합하면 표정 인식에서 딥 뉘앙스 특징의 구분 능력이 향상되는가?
  • RQ2중성 표면과 표현적 표면 간 평균 차이를 동작 마스크 학습의 지도 신호로 사용할 경우, 이러한 지도 없이 엔드 투 엔드 학습을 수행하는 것보다 성능이 향상되는가?
  • RQ3학습된 얼굴 운동 사전 지식은 중성 표면이 확보되지 않은 실외 환경을 포함한 다양한 데이터셋 간에 이식 가능한가?
  • RQ4이러한 방법은 이미지 기반 및 시퀀스 기반 FER 접근법과 비교해 정확도와 강건성 측면에서 어떻게 성능을 내는가?
  • RQ5얼굴 근육 운동 영역에 집중함으로써 CK+, MMI, AffectNet과 같은 벤치마크 데이터셋에서 표정 인식 성능이 얼마나 향상되는가?

주요 결과

  • 제안된 FMPN는 CK+ 데이터셋에서 98.06%의 정확도를 기록하여, GAN 기반 및 시퀀스 기반 접근법을 포함한 모든 이전 최고 성능 방법을 초월한다.
  • MMI 데이터셋에서 FMPN는 82.74%의 정확도를 기록하였으며, 이미지 기반 방법 대비 약 9.51% 향상되었고, 시퀀스 기반 방법 대비 약 7.62% 향상되었다.
  • 대규모 실외 데이터셋인 AffectNet에서 FMPN는 61.52%의 정확도를 기록하였으며, 이는 CK+와 같은 제어된 데이터셋에서 학습한 운동 사전 지식의 이식 가능성과 효과를 입증한다.
  • 제거 실험 결과, 지도 손실($l_G$)을 제거할 경우 CK+에서 정확도가 98.06%에서 91.82%로 감소함을 확인하여 사전 지식 기반 마스크 학습의 중요성을 입증한다.
  • CK+와 MMI에서의 혼동 행렬 분석 결과, 행복이 가장 정확하게 인식되었고, 분노는 혼란도가 가장 높은 감정으로서 혐오와 슬픔과의 혼동이 빈번히 발생하였다.
  • 결과는 얼굴 운동 사전 지식가 일반화 가능하며, 어려운 실외 환경에서도 효과적임을 시사하며, 다양한 데이터셋 간에 근육 운동 패턴이 공통으로 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.