Skip to main content
QUICK REVIEW

[논문 리뷰] Facial Expression Recognition Using Disentangled Adversarial Learning

Kamran Ali, Charles E. Hughes|arXiv (Cornell University)|2019. 09. 28.
Face and Expression Recognition참고 문헌 27인용 수 8
한 줄 요약

이 논문은 얼굴 표정 표현을 신원 및 조명 요소에서 명시적으로 분리하는 디센트렐드 적대적 학습 프레임워크인 DE-GAN을 제안한다. 인코더-디코더 생성기와 신원 조건부 디코딩, 표정 및 신원 분류를 위한 다중 작업 판별기를 사용함으로써, 상태의 기준을 넘는 정확도를 달성하는 분리된, 구분 가능한 표정 특징을 학습한다. CK+, MMI, Oulu-CASIA 데이터셋에서 각각 최고 성능을 기록하며, Oulu-CASIA에서 최대 89.17%의 정확도를 달성한다.

ABSTRACT

The representation used for Facial Expression Recognition (FER) usually contain expression information along with other variations such as identity and illumination. In this paper, we propose a novel Disentangled Expression learning-Generative Adversarial Network (DE-GAN) to explicitly disentangle facial expression representation from identity information. In this learning by reconstruction method, facial expression representation is learned by reconstructing an expression image employing an encoder-decoder based generator. This expression representation is disentangled from identity component by explicitly providing the identity code to the decoder part of DE-GAN. The process of expression image reconstruction and disentangled expression representation learning is improved by performing expression and identity classification in the discriminator of DE-GAN. The disentangled facial expression representation is then used for facial expression recognition employing simple classifiers like SVM or MLP. The experiments are performed on publicly available and widely used face expression databases (CK+, MMI, Oulu-CASIA). The experimental results show that the proposed technique produces comparable results with state-of-the-art methods.

연구 동기 및 목표

  • 기존의 FER 방법이 신원과 표정 정보를 혼합한 엉클러스터드 표현을 학습함으로써, 새로운 신원에 대한 일반화 능력에 악영향을 미치는 한계를 해결하기 위해.
  • 입력 이미지를 다양한 신원으로 재구성함으로써, 분리된 얼굴 표정 표현을 학습하는 생성 모델을 개발하기 위해.
  • GAN 기반 프레임워크와 다중 작업 판별기 감독을 통해 추출한 분리된 특징을 활용하여 얼굴 표정 인식 성능을 향상시키기 위해.
  • 학습된 분리된 표현을 사용하여 소스 신원에서 타겟 신원으로 표정을 전이함으로써 얼굴 표정 합성을 가능하게 하기 위해.

제안 방법

  • DE-GAN 프레임워크는 인코더-디코더 생성기 아키텍처를 사용하며, 인코더가 입력 이미지에서 분리된 표정 표현을 추출한다.
  • 디코더는 입력과 동일한 표정을 가지되, 다른 신원을 가진 얼굴 이미지를 재구성한다. 이때 신원는 입력으로 제공된 신원 코드에 따라 결정된다.
  • 생성기는 실제 또는 가짜 이미지, 그리고 신원 및 표정을 분류하는 다중 작업 판별기를 속임으로써 훈련된다.
  • 분리된 표정 표현은 인코더에서 추출되어, SVM이나 MLP와 같은 단순 분류기와 함께 후속 FER 작업에 사용된다.
  • 훈련 전략은 후기 반복에서 판별기를 더 자주 업데이트하는 대신 생성기를 더 자주 업데이트하며, 표정 및 신원 분류의 지도 레이블을 활용한다.
  • 생성기는 디코더를 신원 코드에 조건부로 설정함으로써, 인코더에서 추출한 표현 표현만을 사용함으로써 표정과 신원 성분을 명시적으로 분리한다.

실험 결과

연구 질문

  • RQ1적대적 학습을 사용하여 FER에서 신원 및 조명 요소로부터 표정 표현을 명시적으로 분리할 수 있는가?
  • RQ2표정과 신원을 분류하는 다중 작업 판별기는 분리된 표정 표현 학습의 품질을 향상시키는가?
  • RQ3재구성 기반 GAN을 통해 추출한 분리된 표정 특징이 표준 FER 벤치마크에서 최고 수준의 성능을 달성할 수 있는가?
  • RQ4데이터의 완전성(예: 각 주제에 대해 전체 표정 커버리지)은 분리 품질과 인식 정확도에 영향을 미치는가?

주요 결과

  • CK+ 데이터셋에서 DE-GAN은 일곱 가지 표정 분류 작업에서 97.28%의 정확도를 기록하여, CNN 베이스라인(90.34%)을 능가했다.
  • MMI 데이터셋에서 DE-GAN은 여섯 가지 표정 분류 작업에서 72.97%의 정확도를 달성하여, CNN 베이스라인(58.46%)보다 뚜렷한 향상을 보였다.
  • Oulu-CASIA 데이터셋에서 DE-GAN은 여섯 가지 표정 분류 작업에서 89.17%의 정확도를 기록했으며, 각 주제에 대해 완전한 표정 커버리지가 있기 때문에 모든 데이터셋 중에서 가장 강력한 성능을 보였다.
  • 결과는 DE-GAN을 통해 학습된 분리된 표정 특징가 매우 구분 가능하며, 특히 각 주제에 대해 모든 표정이 포함된 훈련 데이터가 존재할 경우 잘 일반화됨을 보여준다.
  • 다중 작업 판별기는 표정 및 신원 분류를 함께 감시함으로써 이미지 재구성 품질과 분리도를 크게 향상시킨다.
  • 이 방법은 입력과 동일한 표정을 가지되 다른 신원을 가진 이미지를 생성함으로써 표정 전이를 가능하게 하여, 생성 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.