Skip to main content
QUICK REVIEW

[논문 리뷰] Pre-Trained Convolutional Neural Network Features for Facial Expression Recognition

Aravind Ravi|arXiv (Cornell University)|2018. 12. 16.
Face and Expression Recognition참고 문헌 7인용 수 9
한 줄 요약

이 논문은 사전 훈련된 VGG19 합성곱 신경망 특징을 이용하여 표정 인식을 수행하는 것을 제안하며, 초기 합성곱 레이어에서 추출한 특징을 선형 SVM 분류기로 전이한다. CK+ 및 JAFFE 데이터셋에서 각각 92.86% 및 92.26%의 정확도를 달성하여 ImageNet에서 사전 훈련된 특징, 특히 얕은 레이어에서 유도된 특징이 소규모 표정 인식 데이터셋으로 효과적으로 전이됨을 보여준다.

ABSTRACT

Facial expression recognition has been an active area in computer vision with application areas including animation, social robots, personalized banking, etc. In this study, we explore the problem of image classification for detecting facial expressions based on features extracted from pre-trained convolutional neural networks trained on ImageNet database. Features are extracted and transferred to a Linear Support Vector Machine for classification. All experiments are performed on two publicly available datasets such as JAFFE and CK+ database. The results show that representations learned from pre-trained networks for a task such as object recognition can be transferred, and used for facial expression recognition. Furthermore, for a small dataset, using features from earlier layers of the VGG19 network provides better classification accuracy. Accuracies of 92.26% and 92.86% were achieved for the CK+ and JAFFE datasets respectively.

연구 동기 및 목표

  • ImageNet에서 사전 훈련된 CNN 특징이 표정 인식으로 전이 가능한지 조사한다.
  • 낮은 데이터 환경에서 특징 추출을 위한 다양한 VGG19 네트워크 레이어의 성능을 평가한다.
  • 표정 분류에 있어 초기 레이어와 깊은 레이어의 효율성을 비교한다.
  • 고정밀도를 달성하기 위해 미세조정이 필요한지, 아니면 특징 전이만으로도 충분한지 규명한다.

제안 방법

  • ImageNet에서 훈련된 사전 훈련된 VGG19 모델 가중치를 사용하여 얼굴 이미지의 특징을 추출한다.
  • 특징은 VGG19 네트워크의 여러 레이어에서 추출되며, 특히 초기 합성곱 레이어에 중점을 둔다.
  • 추출된 특징은 평탄화되어 선형 서포트 벡터 머신(SVM)에 입력되어 분류된다.
  • SVM은 두 개의 공개 표정 인식 데이터셋인 CK+ 및 JAFFE에서 훈련되고 평가된다.
  • 다양한 데이터 분할에 대한 안정적인 성능 추정을 위해 교차 검증이 사용된다.
  • 모델은 두 데이터셋 모두에서 표준 정확도 지표를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1미세조정 없이도 ImageNet CNN에서 사전 훈련된 특징이 표정 인식에 효과적으로 활용될 수 있는가?
  • RQ2사전 훈련된 VGG19 네트워크의 어느 레이어에서 표정 인식에 가장 구분력 있는 특징을 도출할 수 있는가?
  • RQ3네트워크의 초기 레이어를 사용하면 소규모 표정 인식 데이터셋에서 성능이 향상되는가?
  • RQ4일반적인 물체 인식 작업에서의 특징 전이가 표현 전용 데이터로의 엔드 투 엔드 훈련과 비교해 볼 때 어떻게 다른가?

주요 결과

  • 모델은 VGG19 네트워크의 초기 레이어에서 추출한 특징을 사용하여 JAFFE 데이터셋에서 92.86%의 분류 정확도를 달성했다.
  • CK+ 데이터셋에서는 92.26%의 정확도를 기록하여 더 작은 데이터셋에서도 강력한 일반화 능력을 보였다.
  • 특징 추출 시 얕은 레이어에서 유도된 특징이 깊은 레이어의 특징보다 더 뛰어난 성능을 보였으며, 특히 낮은 데이터 환경에서 두드러졌다.
  • 미세조정 없이도 사전 훈련된 특징을 사용한 결과 경쟁력 있는 성능을 기록하여 강력한 전이 가능성임을 확인했다.
  • 선형 SVM 분류기는 CNN의 고수준 표현을 효과적으로 활용하여 표정 분류에 기여했다.
  • 결과적으로 사전 훈련된 특징을 활용한 전이 학습이 표정 인식에 실현 가능하고 효과적인 접근법임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.