[논문 리뷰] Physically-Based Face Rendering for NIR-VIS Face Recognition
이 논문은 3D 얼굴 재구성과 새로운 픽셀 단위의 VIS에서 NIR로의 반사율 변환을 활용하여 고품질이면서 신원 일致성을 유지하는 쌍체 NIR-VIS 얼굴 이미지를 생성하기 위한 물리 기반 방법을 제안한다. 대규모 사진과 유사한 데이터셋을 활용하고, 모odal 갭을 줄이며 신원 특징을 강조하기 위해 ID-MMD 손실을 도입함으로써, 기존의 NIR-VIS 데이터셋을 사용하지 않아도 네 개의 NIR-VIS 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 미세조정 이후 더욱 향상되었다.
Near infrared (NIR) to Visible (VIS) face matching is challenging due to the significant domain gaps as well as a lack of sufficient data for cross-modality model training. To overcome this problem, we propose a novel method for paired NIR-VIS facial image generation. Specifically, we reconstruct 3D face shape and reflectance from a large 2D facial dataset and introduce a novel method of transforming the VIS reflectance to NIR reflectance. We then use a physically-based renderer to generate a vast, high-resolution and photorealistic dataset consisting of various poses and identities in the NIR and VIS spectra. Moreover, to facilitate the identity feature learning, we propose an IDentity-based Maximum Mean Discrepancy (ID-MMD) loss, which not only reduces the modality gap between NIR and VIS images at the domain level but encourages the network to focus on the identity features instead of facial details, such as poses and accessories. Extensive experiments conducted on four challenging NIR-VIS face recognition benchmarks demonstrate that the proposed method can achieve comparable performance with the state-of-the-art (SOTA) methods without requiring any existing NIR-VIS face recognition datasets. With slightly fine-tuning on the target NIR-VIS face recognition datasets, our method can significantly surpass the SOTA performance. Code and pretrained models are released under the insightface (https://github.com/deepinsight/insightface/tree/master/recognition).
연구 동기 및 목표
- 강력한 교차 모달 얼굴 인식 모델을 훈련하기 위한 제한된 쌍체 NIR-VIS 얼굴 데이터 문제를 해결한다.
- 모델의 일반화 및 성능을 저해하는 NIR과 VIS 스펙트럼 간의 도메인 갭을 극복한다.
- 합성 데이터 생성 과정에서 다양한 자세, 표정 및 조명 조건에서도 신원 일致성을 유지한다.
- 자세나 액세서리와 같은 부수적인 변형이 아닌 신원 특징에 초점을 맞춘 모달 무관 특징 학습 메커니즘을 개발한다.
- 기존의 쌍체 NIR-VIS 데이터셋을 활용하지 않고도 여러 NIR-VIS 얼굴 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 최신 반사율 확보 방법을 사용하여 대규모 2D 얼굴 이미지 데이터셋에서 3D 얼굴 형태와 반사율 지도를 재구성한다.
- 보편적인 픽셀 단위의 VIS에서 NIR로의 반사율 변환을 적용하여 가시 스펙트럼 반사율을 근적외선 반사율로 변환하면서도 신원을 유지한다.
- 물리 기반 렌더러를 사용하여 통제된 조명, 자세 및 표정 조건 하에서 고해상도이고 사진과 유사한 쌍체 NIR-VIS 이미지를 생성한다.
- 대규모 VIS 얼굴 인식 데이터셋과 합성된 NIR-VIS 쌍체 데이터를 결합하여 얼굴 인식 네트워크를 훈련시킨다.
- NIR 및 VIS 특징 간의 도메인 수준 분포 불일치를 최소화하면서도 신원 중심 특징 학습을 촉진하는 ID 기반 최대 평균 불일치(Identity-based Maximum Mean Discrepancy, ID-MMD) 손실을 도입한다.
- 목표 NIR-VIS 데이터셋에서 신원 손실과 ID-MMD 손실을 사용하여 모델을 미세조정함으로써 성능을 더욱 향상시킨다.
실험 결과
연구 질문
- RQ1새로운 VIS에서 NIR로의 반사율 변환을 적용한 물리 기반 3D 얼굴 렌더링은 고품질이면서 신원 일치성을 유지하는 쌍체 NIR-VIS 얼굴 이미지를 생성할 수 있는가?
- RQ2이러한 합성 데이터셋은 실제 쌍체 NIR-VIS 데이터가 없더라도 NIR-VIS 얼굴 인식 모델을 효과적으로 훈련시킬 수 있는가?
- RQ3제안된 ID-MMD 손실은 NIR 및 VIS 특징 간의 모달 갭을 효과적으로 줄이면서도 신원 관련 패턴에 집중한 학습을 촉진하는가?
- RQ4기본 성능 기준으로 표준 NIR-VIS 얼굴 인식 벤치마크에서 제안된 방법의 성능은 최신 기술 수준의 접근법과 비교해 어떻게 되는가?
- RQ5실제 목표 데이터셋에서의 미세조정이 모델의 일반화 및 정확도를 얼마나 더 향상시킬 수 있는가?
주요 결과
- 제안된 방법은 기존의 NIR-VIS 데이터셋을 사용하지 않아도 CASIA NIR-VIS 2.0 및 Oulu-CASIA NIR-VIS 데이터셋에서 최신 기술 수준의 성능을 달성한다.
- 도전적인 LAMP-HQ 데이터셋에서, 이전 최신 기술 수준 대비 VR@FAR=0.1%에서 19.8% 향상되어 99.0%의 검증률을 기록한다.
- 목표 데이터셋에서의 미세조정 후, LC-29에서 VR@FAR=0.01%에서 99.9%의 성능을 기록하여, 단순 신원 손실만을 사용한 베이스라인 대비 6.6% 향상되었다.
- Oulu-CASIA 및 BUAA-VisNir과 같은 저자료량 데이터셋에서, DVG-Face 대비 각각 VR@FAR=0.1%에서 1.8%와 0.8% 향상되었다.
- 특징 유사도 분포 분석 결과, ID-MMD 손실을 사용한 훈련 후, 동일 신원의 양성 쌍은 유사도가 유의미하게 높고, 부정성 쌍은 유사도가 낮아졌다.
- qualitative 비교를 통해, DVG-Face는 생성 과정에서 신원 이탈을 겪는 반면, 제안된 방법은 생성된 이미지 쌍 간에 완벽한 신원 일치성을 유지함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.