Skip to main content
QUICK REVIEW

[논문 리뷰] Frankenstein: Learning Deep Face Representations using Small Data

Guosheng Hu, Xiaojiang Peng|arXiv (Cornell University)|2016. 03. 21.
Face recognition and analysis참고 문헌 57인용 수 8
한 줄 요약

이 논문은 깊이 있는 얼굴 인식을 위한 대규모 합성 훈련 데이터를 생성하기 위해 실제 얼굴 이미지에서 얼굴 성분(눈, 코, 입)을 조합하는 데이터 합성 방법 Frankenstein을 제안한다. 단지 10,000장의 실제 이미지에 합성된 얼굴 이미지를 보강하여 훈련한 컨볼루션 네트워크(CNN)가 500,000장의 이미지로 훈련된 모델과 유사한 성능을 달성하였으며, CASIA NIR-VIS2.0 데이터셋에서 LDA 미터릭 학습을 사용해 85.05%의 정확도로 새로운 최고 성능을 기록하였다.

ABSTRACT

Deep convolutional neural networks have recently proven extremely effective for difficult face recognition problems in uncontrolled settings. To train such networks, very large training sets are needed with millions of labeled images. For some applications, such as near-infrared (NIR) face recognition, such large training datasets are not publicly available and difficult to collect. In this work, we propose a method to generate very large training datasets of synthetic images by compositing real face images in a given dataset. We show that this method enables to learn models from as few as 10,000 training images, which perform on par with models trained from 500,000 images. Using our approach we also obtain state-of-the-art results on the CASIA NIR-VIS2.0 heterogeneous face recognition dataset.

연구 동기 및 목표

  • 대규모 레이블이 부여된 데이터셋이 확보되지 않은 상황, 특히 근적외선(NIR) 영상과 같은 도메인에서 깊이 있는 CNN을 위한 얼굴 인식 훈련 문제를 해결하기 위해.
  • 소규모 훈련 환경에서 모델 과적합을 유발하는 데이터 부족 문제를 해결하기 위해.
  • 정체성과 의미적 일관성을 유지하면서 다양하고 현실적인 얼굴 이미지를 생성하는 데이터 증강 기법을 개발하기 위해.
  • 얼굴 성분 조합를 통한 합성 데이터 생성을 활용해 최소한의 실제 데이터로도 높은 성능의 얼굴 인식을 가능하게 하기 위해.
  • 엄청난 양의 실제 훈련 데이터가 필요 없이도 CASIA NIR-VIS2.0과 같은 이종 얼굴 인식 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 이 방법은 두 장의 실제 얼굴 이미지에서 자동으로 얼굴 성분(눈, 코, 입)을 검출하고 추출하여 합성된 얼굴 이미지를 생성한다.
  • 다른 주제의 성분을 고정된 공간적 구성으로 조합하여 해부학적으로 타당한 새로운 얼굴 이미지를 생성한다.
  • 합성 데이터 생성 과정은 3D 얼굴 모델이나 수동 주석 없이 완전히 자동화되어 있다.
  • 이 접근법은 국소 자기 적응 특징(LSSF) 정규화와 데이터 융합을 조합하여 가시 영상과 NIR 영상 간의 도메인 차이를 줄인다.
  • 합성된 이미지는 깊이 있는 CNN을 훈련시키는 데 사용되며, 성능 평가는 LFW 및 CASIA NIR-VIS2.0 데이터셋에서 평가된다.
  • LDA를 통한 미터릭 학습을 적용하여 합성 및 실제 데이터에서의 인식 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1실제 이미지에서 추출한 얼굴 성분을 조합하여 생성한 합성 데이터로, 최소한의 실제 훈련 데이터만으로 깊이 있는 CNN을 효과적으로 훈련시킬 수 있는가?
  • RQ2합성 데이터로 훈련된 CNN의 일반화 능력과 정확도는 대규모 실제 데이터셋으로 훈련된 모델에 비해 어떻게 비교되는가?
  • RQ3합성 데이터가 이종 얼굴 인식에서 가시 영상과 근적외선 영상 간의 도메인 갭을 어느 정도 줄일 수 있는가?
  • RQ4원본 및 합성 데이터의 특징 융합은 단독으로 사용할 경우보다 인식 성능을 향상시키는가?
  • RQ5제안된 방법은 거대한 실제 훈련 데이터에 의존하지 않고도 CASIA NIR-VIS2.0과 같은 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 10,000장의 실제 이미지에 합성된 얼굴 이미지를 보강하여 훈련한 CNN이 CASIA NIR-VIS2.0 데이터셋에서 68.97%의 얼굴 인식 정확도를 달성하였으며, 이는 500,000장의 이미지로 훈련된 모델의 성능과 동일했다.
  • LSSF 정규화를 사용함으로써 가시 영상과 NIR 영상 간의 도메인 갭이 감소하여, 새로운 NIR 이미지에 대한 일반화 정확도가 38.45%에서 66.37%로 향상되었다.
  • 원본 LFW 데이터와 합성 LFW 데이터의 특징 융합으로 인식 정확도가 66.37%에서 68.97%로 향상되어 데이터 다양성의 효과를 입증하였다.
  • LDA를 통한 미터릭 학습을 적용한 결과, CASIA NIR-VIS2.0에서 85.05%의 정확도를 기록하여 이전 최고 성능 기법보다 3.2%p 높은 성능을 달성하였다.
  • 메트릭 학습을 사용하지 않은 경우, 수작업으로 설계된 기술자(예: C-CBFD)보다 23.35%p 높은 성능(79.96% 대 56.6%)을 기록하였다.
  • Gabor 특징과 RBMs를 사용한 최고 성능 기법(86.2%)과 비교해도 경쟁 가능한 성능을 달성하였으며, 피드포워드 CNN 기반의 더 빠른 추론 파이프라인을 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.