Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangled Variational Representation for Heterogeneous Face Recognition

Xiang Wu, Huaibo Huang|arXiv (Cornell University)|2018. 09. 06.
Face recognition and analysis참고 문헌 43인용 수 9
한 줄 요약

이 논문은 이방성 얼굴 인식을 위한 탈결합 변동형 표현(DVR) 프레임워크를 제안하며, 변동형 추론을 통해 NIR 및 VIS 얼굴 표현에서 정체성과 개인 내 변동성을 분리한다. 동일 주제에 대한 정체성 정보를 최소화하고, 모odal 변동성 간에 유연한 상관관계 정렬을 적용하여 도메인 간 격차를 줄이고 과적합을 완화함으로써, Oulu-CASIA에서 VR@FAR=1% 기준 최대 19.1% 향상된 성능을 달성하며 최신 기준 데이터셋에서 최고 성능을 기록한다.

ABSTRACT

Visible (VIS) to near infrared (NIR) face matching is a challenging problem due to the significant domain discrepancy between the domains and a lack of sufficient data for training cross-modal matching algorithms. Existing approaches attempt to tackle this problem by either synthesizing visible faces from NIR faces, extracting domain-invariant features from these modalities, or projecting heterogeneous data onto a common latent space for cross-modal matching. In this paper, we take a different approach in which we make use of the Disentangled Variational Representation (DVR) for cross-modal matching. First, we model a face representation with an intrinsic identity information and its within-person variations. By exploring the disentangled latent variable space, a variational lower bound is employed to optimize the approximate posterior for NIR and VIS representations. Second, aiming at obtaining more compact and discriminative disentangled latent space, we impose a minimization of the identity information for the same subject and a relaxed correlation alignment constraint between the NIR and VIS modality variations. An alternative optimization scheme is proposed for the disentangled variational representation part and the heterogeneous face recognition network part. The mutual promotion between these two parts effectively reduces the NIR and VIS domain discrepancy and alleviates over-fitting. Extensive experiments on three challenging NIR-VIS heterogeneous face recognition databases demonstrate that the proposed method achieves significant improvements over the state-of-the-art methods.

연구 동기 및 목표

  • 이방성 얼굴 인식에서 NIR과 VIS 얼굴 이미지 간의 심각한 도메인 갭을 해결한다.
  • NIR 얼굴 인식에서 제한된 학습 데이터로 인한 과적합을 줄인다.
  • 정체성을 개인 내 변동성에서 분리하는, 압축되고 분류 능력이 뛰어난 잠재 표현을 학습한다.
  • 탈결합 표현과 인식 네트워크를 동시에 최적화하여 이방성 매칭 성능을 향상시킨다.
  • 탈결합 변동형 표현과 HFR 네트워크 간 상호 최적화 기반의 개선 전략을 개발하여 일반화 능력을 향상시킨다.

제안 방법

  • 정체성과 개인 내 변동성을 별개의 잠재 변수로 분리할 수 있도록 변동형 오토인코더 프레임워크를 사용해 얼굴 표현을 모델링한다.
  • NIR 및 VIS 모달리티 모두에 대해 근사 사후 분포를 최적화하기 위해 변동형 하한을 사용한다.
  • 동일 주제에 대해 정체성 정보를 최소화하여 탈결합 잠재 공간 내 분류 능력을 향상시킨다.
  • 모달 변동성 간에 유연한 상관관계 정렬 제약 조건을 적용하여 조명 및 스펙트럼 차이를 정렬한다.
  • DVR 모듈과 HFR 네트워크를 번갈아가며 업데이트하는 대안 최적화 기반의 방법을 도입하여 상호 개선을 이룬다.
  • 학습된 사후 분포에서 합성 NIR 및 VIS 샘플을 생성하여 훈련을 증강하고 과적합을 줄인다.

실험 결과

연구 질문

  • RQ1탈결합 변동형 표현은 이방성 얼굴 인식에서 정체성을 개인 내 변동성에서 효과적으로 분리할 수 있는가?
  • RQ2동일 주제에 대해 정체성 정보를 최소화하면 이방성 매칭 성능는 어떻게 향상되는가?
  • RQ3모달 변동성 간의 유연한 상관관계 정렬은 도메인 갭을 어느 정도 줄일 수 있는가?
  • RQ4탈결합 표현과 HFR 네트워크 간의 상호 최적화는 소규모 NIR 데이터셋에서 과적합을 완화하는 데 기여하는가?
  • RQ5제안된 DVR 프레임워크는 도전적인 NIR-VIS 얼굴 인식 기준 데이터셋에서 최신 기술을 초월하는가?

주요 결과

  • CASIA NIR-VIS 2.0에서 DVR는 LightCNN-9를 사용해 랭크-1 정확도 99.1%와 VR@FAR=0.1% 98.6%를 달성하며, 비교된 모든 최신 기술을 능가한다.
  • LightCNN-29를 사용할 경우, DVR는 LightCNN-9 대비 랭크-1 정확도 0.8% 향상 및 VR@FAR=0.1% 1.0% 향상하여 깊이가 증가한 네트워크에서도 확장 가능성을 입증한다.
  • Oulu-CASIA NIR-VIS에서 DVR는 VR@FAR=1% 기준 89.7%를 기록하며, 이전 최고 기술인 W-CNN(81.5%) 대비 8.2% 향상되었다.
  • BUAA-VisNir에서 DVR는 VR@FAR=1% 기준 97.0%를 달성하여 W-CNN 대비 1.0% 향상되었으며, 제한된 데이터에서 강력한 일반화 능력을 보였다.
  • 절단 실험을 통해 탈결합 변동형 구성요소, 평균 차이 최소화, 상관관계 정렬 각각이 성능 향상에 기여한다는 것이 확인되었다.
  • ROC 곡선 분석 결과 DVR는 모든 기준 모델보다 일관되게 뛰어나며, 특히 낮은 거짓 양성 비율에서 뛰어난 안정성과 높은 분류 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.