Skip to main content
QUICK REVIEW

[논문 리뷰] Deep generative-contrastive networks for facial expression recognition

Youngsung Kim, ByungIn Yoo|arXiv (Cornell University)|2017. 03. 21.
Face recognition and analysis참고 문헌 37인용 수 75
한 줄 요약

본 논문은 단일 이미지 얼굴 표정 인식 프레임워크인 GCNet을 제안한다. 생성 참조 이미지, 대조 표현, 판별 학습을 결합하여 CK+, MMI, Oulu-CASIA 데이터셋에서 최첨단 성능을 달성한다.

ABSTRACT

As the expressive depth of an emotional face differs with individuals or expressions, recognizing an expression using a single facial image at a moment is difficult. A relative expression of a query face compared to a reference face might alleviate this difficulty. In this paper, we propose to utilize contrastive representation that embeds a distinctive expressive factor for a discriminative purpose. The contrastive representation is calculated at the embedding layer of deep networks by comparing a given (query) image with the reference image. We attempt to utilize a generative reference image that is estimated based on the given image. Consequently, we deploy deep neural networks that embed a combination of a generative model, a contrastive model, and a discriminative model with an end-to-end training manner. In our proposed networks, we attempt to disentangle a facial expressive factor in two steps including learning of a generator network and a contrastive encoder network. We conducted extensive experiments on publicly available face expression databases (CK+, MMI, Oulu-CASIA, and in-the-wild databases) that have been widely adopted in the recent literatures. The proposed method outperforms the known state-of-the art methods in terms of the recognition accuracy.

연구 동기 및 목표

  • 단일 이미지에서 표현이 애매한 상황에서 동일 인상의 참조(생성) 이미지를 활용하여 강건한 표현 인식을 모티브로 삼는다.
  • 입력 이미지와 참조 이미지 간의 차별적 표현 변화를 포착하는 대조 잠재 표현을 개발한다.
  • 생성, 대조, 판별 학습을 하나의 엔드-투-엔드 네트워크에 통합하여 인식 성능을 향상시킨다.
  • 생성 참조 및 대조 학습을 갖춘 단일 이미지 기반 접근법이 일부 다중 이미지나 시간적 방법보다 우수할 수 있음을 보여준다.

제안 방법

  • GCNet을 제안하고, 입력으로부터 참조 이미지를 생성하고, 대조 잠재 표현을 추출하며, 엔드-투-엔드 프레임워크에서 분류를 수행하도록 공동으로 학습한다.
  • 대조 표현 델타를 입력 X의 정규화된 잠재 인코딩 En(X)과 생성된 참조 Xhat_r의 인코딩 En(Xhat_r) 간의 거리로 정의한다: delta = d(En(X), En(Xhat_r)).
  • 참조 이미지를 추정하기 위해 인코더 En과 디코더 De로 구성된 제너레이터 G를 사용하여 Xhat_r을 추정하고 X ≈ Xhat_r + epsilon으로 모델링한다.
  • 다양한 손실로 학습한다: 표현에 대한 판별적 교차 엔트로피 손실, Xhat_r과 Xr 간의 생성적 L2 손실, 잠재 공간의 대조 손실, 입력 디코더와 참조 디코더에 대한 재구성 손실.
  • 조합 목표 L = LCls + lambda_G LGen + lambda_S LContr + LRecon을 최적화하여 판별적, 생성적, 대조적, 재구성 목표를 균형 있게 달성한다.
  • 먼저 표현 관련 변동성을 제거하기 위해 참조를 생성하는 2단계 분리 전략을 채택한 뒤, 판별적 특징을 위한 대조 인코더를 학습한다.

실험 결과

연구 질문

  • RQ1생성 참조 이미지가 표정 인식의 판별 성능을 향상시키는가?
  • RQ2대조적 메트릭 학습을 생성 참조와 결합하여 표정의 판별 잠재 표현을 생성할 수 있는가?
  • RQ3생성 및 대조 학습이 가능한 단일 이미지 기반 접근법이 다중 이미지나 시간적 방법을 능가하는가?
  • RQ4재구성 손실이 대조 표현의 품질과 분류 정확도에 미치는 영향은 무엇인가?

주요 결과

  • 대조 및/또는 재구성 손실을 사용하는 GCNet 변형은 CK+에서 단일 이미지 기본값 및 일부 다중 이미지 방법을 포함하여 여러 최첨단 방법보다 우수한 성능을 보인다.
  • S1R1 변형(대조 + 재구성)이 제안된 모델 중 CK+에서 보고된 가장 높은 정확도를 달성한다.
  • CK+의 7개 및 8개 표현, MMI, Oulu-CASIA VIS 전반에 걸쳐 GCNet 계열은 핸드크래프트, CNN 기반 및 일부 영상 기반 방법과 비교해 경쟁력 있거나 우수한 결과를 보인다.
  • 시각화(t-SNE)를 통해 GCNet 특징이 CNN 기반 대비 더 잘 표현 클래스를 군집화하여 더 구분 가능한 잠재 표현을 시사한다.
  • 생성 구성 요소를 VAE나 GAN으로 교체한 실험은 프레임워크가 다양한 생성 백본과도 호환됨을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.