Skip to main content
QUICK REVIEW

[논문 리뷰] How Transferable are CNN-based Features for Age and Gender Classification?

Gökhan Özbulak, Yusuf Aytar|arXiv (Cornell University)|2016. 10. 01.
Face recognition and analysis참고 문헌 21인용 수 10
한 줄 요약

이 논문은 제약 조건이 없는 환경에서 연령 및 성별 분류에 대해 사전 훈련된 CNN 특징의 이식성에 대해 조사한다. Adience 데이터셋을 사용하여 일반적인 (AlexNet 유사) 및 도메인 특화된 (VGG-Face) CNN 모델을 미세 조정한 결과, 전이 학습이 작업 특화 CNN (GilNet)을 처음부터 훈련하는 것보다 연령 분류에서 7%, 성별 분류에서 4.5% 높은 정확도를 기록함을 입증하였다.

ABSTRACT

Age and gender are complementary soft biometric traits for face recognition. Successful estimation of age and gender from facial images taken under real-world conditions can contribute improving the identification results in the wild. In this study, in order to achieve robust age and gender classification in the wild, we have benefited from Deep Convolutional Neural Networks based representation. We have explored transferability of existing deep convolutional neural network (CNN) models for age and gender classification. The generic AlexNet-like architecture and domain specific VGG-Face CNN model are employed and fine-tuned with the Adience dataset prepared for age and gender classification in uncontrolled environments. In addition, task specific GilNet CNN model has also been utilized and used as a baseline method in order to compare with transferred models. Experimental results show that both transferred deep CNN models outperform the GilNet CNN model, which is the state-of-the-art age and gender classification approach on the Adience dataset, by an absolute increase of 7% and 4.5% in accuracy, respectively. This outcome indicates that transferring a deep CNN model can provide better classification performance than a task specific CNN model, which has a limited number of layers and trained from scratch using a limited amount of data as in the case of GilNet. Domain specific VGG-Face CNN model has been found to be more useful and provided better performance for both age and gender classification tasks, when compared with generic AlexNet-like model, which shows that transfering from a closer domain is more useful.

연구 동기 및 목표

  • 실세계의 제약 조건이 없는 조건에서 사전 훈련된 CNN을 사용한 전이 학습의 효과성을 평가하는 것.
  • 일반적인 CNN 아키텍처(예: AlexNet 유사)와 도메인 특화 모델(예: VGG-Face)이 연령 및 성별 분류 작업에서 어떻게 성능을 내는지 비교하는 것.
  • 대규모 얼굴 인식 데이터셋에서 사전 훈련된 모델에서 전이 학습을 통해 성능이 처음부터 작업 특화 CNN을 훈련하는 것보다 향상되는지 평가하는 것.
  • 전이 학습의 효과성에 영향을 미치는 도메인 유사성의 영향을 규명하는 것.

제안 방법

  • Adience 데이터셋에서 연령 및 성별 분류를 위해 일반적인 AlexNet 유사 CNN 아키텍처를 미세 조정하는 것.
  • 대규모 얼굴 인식 데이터에서 사전 훈련된 도메인 특화 VGG-Face CNN 모델을 동일한 작업에 대해 미세 조정하는 것.
  • 기준 비교를 위해 Adience 데이터셋에서 처음부터 작업 특화 CNN(GilNet)을 훈련하는 것.
  • 사전 훈련된 모델에서 특징을 전이하여 목표 연령 및 성별 분류 작업에 적응시키는 전이 학습을 사용하는 것.
  • 표준 훈련 프로토콜을 사용하여 확률적 경사 하강법과 데이터 증강을 통해 성능을 최적화하는 것.
  • Adience 벤치마크 데이터셋에서 표준 지표(예: 정확도)를 사용하여 모델 성능을 평가하는 것.

실험 결과

연구 질문

  • RQ1일반적이거나 도메인 특화된 모델에서 사전 훈련된 CNN 특징를 사용할 경우, 작업 특화 CNN을 처음부터 훈련하는 것보다 연령 및 성별 분류 정확도가 향상되는가?
  • RQ2사전 훈련된 모델의 선택(예: AlexNet 유사 vs. VGG-Face)이 제약 조건이 없는 환경에서 연령 및 성별 분류 성능에 어떻게 영향을 미치는가?
  • RQ3관련 도메인(예: 얼굴 인식)에서 사전 훈련된 모델에서 특징을 전이하면 일반적인 이미지 분류 모델에서 전이하는 것보다 더 좋은 결과를 얻을 수 있는가?
  • RQ4제한된 데이터에서 작업 특화 CNN을 처음부터 훈련하는 것에 비해 전이 학습의 상대적 성능 향상은 어느 정도인가?
  • RQ5사전 훈련된 도메인과 목표 작업 간의 도메인 유사성이 CNN 특징의 이식성에 어떻게 영향을 미치는가?

주요 결과

  • 사전 훈련된 CNN을 사용한 전이 학습은 작업 특화 CNN(GilNet)을 처음부터 훈련하는 것보다 유의미하게 높은 성능을 보이며, 연령 분류에서 7%p의 절대 정확도 향상을 달성하였다.
  • 도메인 특화된 VGG-Face 모델이 일반적인 AlexNet 유사 모델보다 더 높은 성능을 보였으며, 이는 더 가까운 도메인에서 전이할 경우 더 우수한 결과를 얻을 수 있음을 시사한다.
  • VGG-Face 기반 모델은 일반적인 AlexNet 유사 모델보다 연령 및 성별 분류 모두에서 더 높은 정확도를 기록하였다.
  • Adience 데이터셋에서 사전 훈련된 모델을 미세 조정함으로써 성별 분류 정확도가 기준 모델인 GilNet 대비 4.5%p 향상되었다.
  • 결과는 제약 조건이 없는 실세계 환경에서 얼굴 특성 추정에 전이 학습이 매우 효과적임을 보여준다.
  • 이 연구는 도메인 특화 사전 훈련이 특히 훈련 데이터가 제한된 경우 특징 전이 가능성을 향상시킴을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.