[논문 리뷰] Cross-spectral Face Completion for NIR-VIS Heterogeneous Face Recognition
이 논문은 근적외선(NIR) 입력에서 고해상도의 정방향 가시(VIS) 얼굴 이미지를 텍스처 보정 및 자세 보정 구성 요소를 결합하여 합성하는 엔드 투 엔드 딥 생성 프레임워크인 크로스스펙트럴 페이스 커플리션(Cross-spectral Face Completion, CFC)을 제안한다. 일대다 비지도 이미지 번역을 일대일 쌍화된 번역으로 변환함으로써 CFC는 CASIA NIR-VIS 2.0 데이터셋에서 최신 기준의 랭크-1 정확도 100%를 달성하여 이질적 얼굴 인식 성능을 크게 향상시켰다.
Near infrared-visible (NIR-VIS) heterogeneous face recognition refers to the process of matching NIR to VIS face images. Current heterogeneous methods try to extend VIS face recognition methods to the NIR spectrum by synthesizing VIS images from NIR images. However, due to self-occlusion and sensing gap, NIR face images lose some visible lighting contents so that they are always incomplete compared to VIS face images. This paper models high resolution heterogeneous face synthesis as a complementary combination of two components, a texture inpainting component and pose correction component. The inpainting component synthesizes and inpaints VIS image textures from NIR image textures. The correction component maps any pose in NIR images to a frontal pose in VIS images, resulting in paired NIR and VIS textures. A warping procedure is developed to integrate the two components into an end-to-end deep network. A fine-grained discriminator and a wavelet-based discriminator are designed to supervise intra-class variance and visual quality respectively. One UV loss, two adversarial losses and one pixel loss are imposed to ensure synthesis results. We demonstrate that by attaching the correction component, we can simplify heterogeneous face synthesis from one-to-many unpaired image translation to one-to-one paired image translation, and minimize spectral and pose discrepancy during heterogeneous recognition. Extensive experimental results show that our network not only generates high-resolution VIS face images and but also facilitates the accuracy improvement of heterogeneous face recognition.
연구 동기 및 목표
- NIR과 VIS 스펙트럼 간의 크로스스펙트럴 얼굴 인식 문제를 해결하기 위해, NIR 이미지가 자기 음영과 감지 갭으로 인해 텍스처가 불완전해지는 문제를 다루기 위함이다.
- 자세 보정 구성 요소를 도입하여 일대다 비지도 이미지 간 번역의 복잡성을 줄여 NIR과 VIS의 자세를 정렬함으로써 문제를 단순화하기 위함이다.
- 다중 척도 및 세밀한 판별자와 픽셀, 적대적, 신원 유지 손실을 통합함으로써 합성 품질과 인식 정확도를 향상시키기 위함이다.
- 이질적 얼굴 인식에서 크로스스펙트럴 얼굴 합성의 체계적 평가를 위한 새로운 벤치마크를 CASIA NIR-VIS 2.0에 설정하기 위함이다.
제안 방법
- 이 프레임워크는 NIR 입력에서 VIS 텍스처를 생성하는 텍스처 보정 구성 요소와 비정방향 NIR 얼굴을 정방향 VIS 자세로 매핑하는 자세 보정 구성 요소를 조합한다.
- 두 구성 요소를 통합하기 위해 워핑 절차를 적용하여 엔드 투 엔드 딥 네트워크를 구성함으로써, 한 NIR 입력에서 해당하는 정방향 VIS 출력으로의 쌍화된 이미지 번역을 가능하게 한다.
- 다중 척도 웨이블릿 기반 판별자는 고주파 수준의 세부 정보와 시각적 품질을 감시하며, 세밀한 판별자는 생성된 얼굴의 내부 클래스 변동성을 줄인다.
- 손실 함수는 픽셀 손실, 최종 이미지와 웨이블릿 분해에 각각 적용되는 두 개의 적대적 손실, 그리고 신원 일관성을 유지하기 위한 신원 유지 손실을 조합한다.
- 모델은 실제 NIR-VIS 쌍 데이터와 합성 데이터 증강을 조합하여 훈련하며, 스펙트럼 및 자세의 차이를 최소화하는 것을 목표로 한다.
실험 결과
연구 질문
- RQ1일대다 비지도 번역 대비 쌍화된 이미지 간 번역 문제로 크로스스펙트럴 얼굴 합성을 모델링할 경우, 인식 정확도 향상에 기여하는가?
- RQ2자세 보정과 텍스처 보정의 통합은 생성된 VIS 얼굴의 내부 클래스 변동성을 줄이고 시각적 정확도를 향상시키는 데 얼마나 효과적인가?
- RQ3다중 척도 및 세밀한 판별자는 생성된 NIR에서 VIS로의 얼굴 이미지의 인지적 품질과 인식 성능을 얼마나 향상시키는가?
- RQ4통합된 생성 프레임워크는 도메인 간 쌍화된 훈련 데이터가 없더라도 이질적 얼굴 인식 벤치마크에서 최신 기준 성능을 달성할 수 있는가?
주요 결과
- CFC는 CASIA NIR-VIS 2.0 데이터셋에서 랭크-1 정확도 100%를 달성하여 이질적 얼굴 인식에서 이미지 합성 방식으로는 최초로 이 수준의 높은 점수를 기록했다.
- Oulu-CASIA NIR-VIS 데이터베이스에서 CFC는 랭크-1 정확도 99.9%, FAR=1%일 때 인증률 98.1%, FAR=0.1%일 때 90.7%를 기록하여 비교된 모든 방법들을 능가했다.
- 절단 실험 결과, 신원 유지 손실이 귀나 머리카락과 같이 NIR 이미지에서 자주 누락되는 세부 얼굴 특징의 재구성에 크게 기여하는 것으로 확인되었다.
- 웨이블릿 기반 다중 척도 판별자는 더 선명한 얼굴 세부 정보와 더 낮은 흐릿함을 보여주어 국소 텍스처 품질을 향상시켰다.
- 최종 이미지에 대한 적대적 판별자(L_G_F, L_D_F)를 제거할 경우 결과가 더 흐릿해지며, 이는 시각적 품질 유지를 위한 핵심 기능임을 입증한다.
- 자세 보정 구성 요소는 일대일 번역을 가능하게 하여 학습 문제를 단순화하고 도메인 이동을 줄이며, 높은 인식 정확도에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.