Skip to main content
QUICK REVIEW

[논문 리뷰] SSPP-DAN: Deep Domain Adaptation Network for Face Recognition with Single Sample Per Person

Sungeun Hong, Woobin Im|arXiv (Cornell University)|2017. 02. 14.
Face recognition and analysis참고 문헌 13인용 수 20
한 줄 요약

이 논문은 단일 샘플당 한 명의 사람을 대상으로 하는 (SSPP) 얼굴 인식 문제를 다루기 위해 도메인 적응 기반의 딥 네트워크인 SSPP-DAN을 제안한다. 이는 이질적인 영상 조건 하에서 특성 학습, 도메인 적응, 분류를 동시에 수행하기 위해 도메인 적대적 훈련을 사용한다. 3D 얼굴 모델에서 다양한 자세 변화를 합성하고 비지도 도메인 적응을 적용함으로써, 실제 SSPP 데이터셋에서 기준 방법 대비 19.31%의 정확도 향상을 달성하였으며, LFW-SSPP에서 최신 기술 수준의 성능을 확보하였다.

ABSTRACT

Real-world face recognition using a single sample per person (SSPP) is a challenging task. The problem is exacerbated if the conditions under which the gallery image and the probe set are captured are completely different. To address these issues from the perspective of domain adaptation, we introduce an SSPP domain adaptation network (SSPP-DAN). In the proposed approach, domain adaptation, feature extraction, and classification are performed jointly using a deep architecture with domain-adversarial training. However, the SSPP characteristic of one training sample per class is insufficient to train the deep architecture. To overcome this shortage, we generate synthetic images with varying poses using a 3D face model. Experimental evaluations using a realistic SSPP dataset show that deep domain adaptation and image synthesis complement each other and dramatically improve accuracy. Experiments on a benchmark dataset using the proposed approach show state-of-the-art performance. All the dataset and the source code can be found in our online repository (https://github.com/csehong/SSPP-DAN).

연구 동기 및 목표

  • 갤러리(안정된) 이미지와 프로브(제약 없는) 이미지 간에 심한 도메인 이동이 발생하는 상황에서, 한 명의 사람당 하나의 갤러리 이미지만 제공되는 경우(즉, SSPP) 얼굴 인식 문제를 해결한다.
  • 단일 3D 얼굴 모델 기반 재구성으로부터 기존 갤러리 이미지에서 다양한 자세를 가진 합성 얼굴 이미지를 생성하여 원천 도메인의 훈련 데이터 다양성을 높임으로써 SSPP에서의 데이터 부족 문제를 해결한다.
  • 합성된 이미지를 원천 도메인의 증강된 훈련 샘플로 사용하여 모델의 일반화 능력을 향상시키고, 실제 샘플 수가 제한되어 있어 발생할 수 있는 과적합을 완화한다.
  • 도메인 적대적 훈련을 통해 도메인 구분자(Domain Discriminator)를 훈련시켜 원천(합성/안정) 도메인과 타겟(실제/프로브) 도메인의 특징를 구분하도록 하여, 도메인 간 불변 표현을 유도함으로써 갤러리 이미지와 노이즈가 많고 흐릿하며 자세가 변하는 프로브 이미지 간의 도메인 갭을 줄인다.
  • 실제 구현 환경에서의 제약 조건을 고려하여 영상 합성과 도메인 적응의 상호보완적 효과가 정확도 향상에 기여하는지 입증한다.
  • 실제 갤러리와 프로브 세트를 다양한 조건에서 촬영한 새로운 벤치마크 데이터셋(EK-LFH)을 구축하여 SSPP 방법을 평가한다.

제안 방법

  • 기울기 반전층(GRL)을 사용한 도메인 적대적 훈련을 통해 특성 추출, 도메인 적응, 분류를 동시에 수행하는 통합된 딥 신경망 아키텍처를 제안한다.
  • 원래 갤러리 이미지의 3D 얼굴 모델 기반 재구성에서 유도된 단일 3D 얼굴 모델을 이용해 다양한 자세를 가진 합성 얼굴 이미지를 생성하여 훈련 데이터의 다양성을 증가시킨다.
  • 합성된 이미지를 원천 도메인의 증강된 훈련 샘플로 활용하여 모델의 일반화 능력을 향상시키고, 실제 샘플 수가 적어 발생할 수 있는 과적합을 완화한다.
  • 비지도 도메인 적응을 적용하기 위해 도메인 구분자를 훈련시켜 원천(합성/안정) 도메인과 타겟(실제/프로브) 도메인의 특징를 구분하도록 하여 도메인 간 불변 표현을 유도한다.
  • 백프로파게이션을 사용하여 전체 네트워크를 엔드 투 엔드 방식으로 훈련시켜 특성 학습과 도메인 정렬을 동시에 최적화한다.
  • 전이 학습을 위해 사전 훈련된 VGG-Face 특징를 백본으로 활용하고, 타겟 도메인에서의 준지도 및 완전 지도 설정에서 모델을 미세 조정한다.
Fig. 2 : Outline of the SSPP-DAN. Image synthesis is used to increase the number of samples in the source domain. The feature extractor and two classifiers are used to bridge the gap between source domain (i.e., stable images) and target domain (i.e., unstable images) by adversarial training with gr
Fig. 2 : Outline of the SSPP-DAN. Image synthesis is used to increase the number of samples in the source domain. The feature extractor and two classifiers are used to bridge the gap between source domain (i.e., stable images) and target domain (i.e., unstable images) by adversarial training with gr

실험 결과

연구 질문

  • RQ1합성 데이터 생성과 딥 도메인 적응을 결합할 경우, 도메인 이동 상황에서 SSPP 얼굴 인식의 정확도 향상에 상당한 기여를 할 수 있는가?
  • RQ2라벨이 없는 프로브 데이터를 요구하지 않고도, 도메인 적대적 훈련이 안정된 갤러리 이미지와 제약 없는 프로브 이미지 간의 특징 분포를 얼마나 효과적으로 정렬할 수 있는가?
  • RQ3한 명의 사람당 한 장의 실제 샘플만 존재하는 상황에서, 3D 얼굴 모델 기반 영상 합성을 통한 데이터 증강이 모델 성능 향상에 어느 정도 기여하는가?
  • RQ4영상 합성과 도메인 적응의 상호보완적 상호작용이 각각 독립적으로 적용했을 때보다 더 높은 성능을 내는가?
  • RQ5제안된 방법이 LFW-SSPP와 같은 기준 벤치마크 데이터셋에 일반화되어 실생활의 이질적 환경에서도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 EK-LFH 데이터셋에서, 타겟 도메인에 레이블을 사용하지 않은 상태에서 SSPP-DAN은 원천 도메인 전용 기준 방법 대비 19.31%포인트의 정확도 향상을 달성하였다.
  • 합성 영상 생성과 비지도 도메인 적응의 조합은 원천 도메인에서만 합성 데이터로 훈련한 경우 대비 27.42%포인트의 성능 향상을 기록하였다.
  • 원천 도메인 전용 기준 방법에 합성 이미지를 추가하면 성능이 악화되었으며, 이는 도메인 이동 문제를 해결하기 위해 도메인 적응 없이 영상 합성만으로는 부족하다는 것을 시사한다.
  • 타겟 도메인에서 사람당 3개의 레이블된 예제만 존재하는 준지도 설정에서 SSPP-DAN은 72.08%의 정확도를 달성하여 준지도 DAN 기준 방법(67.28%)을 크게 앞서갔다.
  • LFW-SSPP 벤치마크에서 SSPP-DAN은 97.91%의 인식 정확도를 기록하여 이전 최고 성능 방법을 초월하였으며, '와일드'(wild) 데이터 분포로의 강력한 일반화 능력을 입증하였다.
(a) DA fails to work because of the lack of samples in the source domain
(a) DA fails to work because of the lack of samples in the source domain

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.