Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Heterogeneous Face Recognition with Conditional Adversarial Networks

Wuming Zhang, Zhixin Shu|arXiv (Cornell University)|2017. 09. 08.
Face recognition and analysis참고 문헌 23인용 수 12
한 줄 요약

이 논문은 이종성 얼굴 인식(HFR)을 위한 조건부 생성 적대적 네트워크(cGAN) 기반 방법을 제안하며, 단일 2D 색상 이미지에서 2.5D 깊이 이미지를 재구성하여 정확한 다중 모odal 매칭을 가능하게 한다. 2D 및 2.5D 특징 추출을 위한 별도의 CNN을 훈련하고 다중 모달 매칭 점수를 융합함으로써, 실시간 추론(1.6 ms per image)을 제공하면서도 FRGC 2D/3D 벤치마크에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Heterogeneous face recognition between color image and depth image is a much desired capacity for real world applications where shape information is looked upon as merely involved in gallery. In this paper, we propose a cross-modal deep learning method as an effective and efficient workaround for this challenge. Specifically, we begin with learning two convolutional neural networks (CNNs) to extract 2D and 2.5D face features individually. Once trained, they can serve as pre-trained models for another two-way CNN which explores the correlated part between color and depth for heterogeneous matching. Compared with most conventional cross-modal approaches, our method additionally conducts accurate depth image reconstruction from single color image with Conditional Generative Adversarial Nets (cGAN), and further enhances the recognition performance by fusing multi-modal matching results. Through both qualitative and quantitative experiments on benchmark FRGC 2D/3D face database, we demonstrate that the proposed pipeline outperforms state-of-the-art performance on heterogeneous face recognition and ensures a drastically efficient on-line stage.

연구 동기 및 목표

  • 프로브 이미지가 2D 색상 이미지이지만 갤러리에 3D 깊이 데이터가 포함된 이종성 얼굴 인식(HFR)의 과제를 해결한다.
  • 조명 및 자세 변화에 취약한 2D 얼굴 인식의 한계를 3D 형태 정보를 활용하여 극복한다.
  • 조건부 GAN을 사용하여 단일 2D 색상 이미지에서 현실적인 깊이 이미지를 재구성하는 엔드 투 엔드 프레임워크를 개발한다.
  • 실시간 HFR를 실현하기 위해 온라인 추론 시 3D 데이터 수집을 피하면서도 높은 정확도를 유지한다.
  • 2D 및 2.5D 매칭 점수를 융합하여 기존의 다중 모달 방법을 뛰어넘는 정확도 향상을 달성한다.

제안 방법

  • 2D(색상) 및 2.5D(깊이) 얼굴 특징 추출을 위한 별도의 딥 CNN을 훈련하여 사전 훈련된 모델로 활용한다.
  • 스킵 연결과 오토에인코더를 갖춘 조건부 GAN(cGAN)을 구현하여 2D 색상 이미지에서 2.5D 깊이 이미지를 재구성한다.
  • 모달 간 특징를 정렬하기 위해 소프트맥스 분류 손실과 상관관계 손실을 조합한 공동 손실 함수를 사용한다.
  • 2D 및 2.5D 특징 간의 다중 모달 상관관계를 학습하기 위해 이중 방향 CNN을 적용한다.
  • 2D 및 2.5D 매칭 점수를 융합하여 정확도 향상을 도모한다.
  • 검증 시 실질적인 3D 촬영 없이 오직 2D 프로브 이미지와 재구성된 2.5D 깊이 이미지만을 사용하여 추론를 수행한다.

실험 결과

연구 질문

  • RQ1조건부 GAN이 단일 2D 색상 얼굴 이미지에서 HFR를 위한 현실적인 2.5D 깊이 이미지를 효과적으로 재구성할 수 있는가?
  • RQ22D 및 2.5D 매칭 점수의 융합이 단모달 또는 전통적인 다중 모달 방법에 비해 정확도 향상에 기여하는가?
  • RQ3강건한 다중 모달 특징 학습을 위해 공동 훈련 목표에서 소프트맥스 손실과 상관관계 손실 간 최적의 균형은 무엇인가?
  • RQ4깊이 재구성 및 다중 모달 매칭의 복잡성에도 불구하고 제안된 방법이 실시간 성능를 확보할 수 있는가?
  • RQ5학습 데이터가 제한된 극단적인 얼굴 조건(예: 수염, 그림자)에 대해 이 방법은 일반화 성능가능한가?

주요 결과

  • 제안된 방법은 Huang 등(2012)의 프로토콜에 따라 FRGC 데이터셋에서 랭크-1 정확도 0.9792를 달성하여 최신 기술 수준의 방법을 능가한다.
  • Wang 등(2014)의 프로토콜에서 랭크-1 정확도 0.9745를 기록하여 이전 최고 성능인 0.9600을 초월한다.
  • 단일 NVIDIA GTX TITAN X GPU에서 이미지당 1.6ms의 속도로 깊이 이미지를 재구성하여 실시간 추론가능하다.
  • 제거 실험 결과, 상관관계 손실 가중치 λ = 0.6일 때 최적의 성능를 기록하며, λ > 0.8일 경우 정확도가 크게 감소한다.
  • 상관관계 손실을 제거한 경우(λ = 0)에도 92.45%의 정확도를 유지하여, 소프트맥스 손실만으로도 네트워크가 유용한 특징을 학습할 수 있음을 시사한다.
  • 이 방법은 3D 프로토타입 모델에 의존하지 않고 2.5D 깊이 재구성을 처음으로 달성하여 일반화 성능를 향상시키고 이전 3D 얼굴 데이터베이스에 대한 의존도를 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.