[논문 리뷰] Adversarial Discriminative Heterogeneous Face Recognition
이 논문은 이방성 얼굴 인식(HFR)을 위한 엔드 투 엔드 적대적 판별 특징 학습 프레임워크를 제안한다. 이는 픽셀 공간에서 GAN 기반의 교차 스펙트럼 얼굴 환영화 기법과 특징 공간에서의 적대적 손실 및 고차원 분산 이질성 손실을 결합하여 모odal 갭을 줄인다. 이 방법은 대규모 쌍화된 데이터나 복잡한 아키텍처가 필요 없이도 세 개의 NIR-VIS 데이터베이스에서 256D의 컴팩트한 특징을 사용하여 최신 기술 수준(SOTA) 성능을 달성한다.
The gap between sensing patterns of different face modalities remains a challenging problem in heterogeneous face recognition (HFR). This paper proposes an adversarial discriminative feature learning framework to close the sensing gap via adversarial learning on both raw-pixel space and compact feature space. This framework integrates cross-spectral face hallucination and discriminative feature learning into an end-to-end adversarial network. In the pixel space, we make use of generative adversarial networks to perform cross-spectral face hallucination. An elaborate two-path model is introduced to alleviate the lack of paired images, which gives consideration to both global structures and local textures. In the feature space, an adversarial loss and a high-order variance discrepancy loss are employed to measure the global and local discrepancy between two heterogeneous distributions respectively. These two losses enhance domain-invariant feature learning and modality independent noise removing. Experimental results on three NIR-VIS databases show that our proposed approach outperforms state-of-the-art HFR methods, without requiring of complex network or large-scale training dataset.
연구 동기 및 목표
- 이방성 얼굴 모odal 간의 감지 갭(NIR과 VIS 간)을 해결함으로써 정확한 얼굴 인식을 가능하게 하기 위해.
- 쌍화된 훈련 데이터가 부족한 교차 스펙트럼 얼굴 인식 문제를 해결하기 위해, 개선된 환영화를 위한 이중 경로 GAN 아키텍처를 활용함으로써.
- 모든 모달 간의 전역 및 국소 분포 이질성을 최소화하여 도메인 불변적이고 판별력 있는 특징을 학습하기 위해.
- 교차 스펙트럼 얼굴 환영화와 판별적 특징 학습을 하나의 엔드 투 엔드 적대적 네트워크로 통합하여 공동 최적화를 실현하기 위해.
- 대규모 데이터셋이나 복잡한 네트워크에 의존하지 않고도 컴팩트한 특징 표현을 통해 높은 인식 정확도를 달성하기 위해.
제안 방법
- 픽셀 공간에서 이중 경로 GAN 아키텍처를 사용하여 NIR 입력에서 사진 수준의 VIS 얼굴을 생성함으로써, 전역 구조와 국소 무늬를 모두 모델링함으로써 이미지 품질을 향상시킨다.
- 특징 공간에서 적대적 손실을 도입하여 이방성 얼굴 특징 간의 전역 분포를 정렬한다.
- 고차원 분산 이질성(CVD) 손실을 적용하여 국소 변동성과 모달에 독립적인 노이즈를 줄이고, 내부 개인 일관성을 향상시킨다.
- 픽셀 공간의 환영화와 특징 공간의 도메인 적응을 엔드 투 엔드 적대적 네트워크에서 공동 최적화하도록 통합한다.
- GAN, 적대적 손실, CVD 손실의 공동 최적화를 통해 학습된 256차원 특징 표현을 사용하며, 이는 컴팩트하고 판별력 있는 특징이다.
실험 결과
연구 질문
- RQ1픽셀 공간과 특징 공간에서의 적대적 학습이 이방성 얼굴 인식에서 감지 갭을 효과적으로 줄일 수 있는가?
- RQ2쌍화된 훈련 데이터가 부족한 상황에서 이중 경로 GAN 아키텍처는 교차 스펙트럼 얼굴 환영화를 어떻게 향상시킬 수 있는가?
- RQ3적대적 손실과 고차원 분산 이질성 손실은 도메인 불변적이고 판별력 있는 특징 학습을 어느 정도 향상시키는가?
- RQ4환영화와 특징 학습의 공동 최적화는 분리된 접근 방식보다 더 나은 인식 성능을 낼 수 있는가?
- RQ5대규모 또는 쌍화된 훈련 데이터가 필요 없이도 컴팩트한 256D 특징 표현이 최신 기술 수준 성능을 달성할 수 있는가?
주요 결과
- CASIA NIR-VIS 데이터베이스에서 제안된 방법은 랭크-1 정확도 98.15%와 FAR=0.1%일 때 검증 정확도 97.18%를 달성하여 이전 SOTA 방법인 IDR보다 각각 0.81%와 1.45% 높게 성과를 냈다.
- BUAA-VisNir 데이터베이스에서 방법은 랭크-1 정확도 95.2%와 FAR=0.1%일 때 검증 정확도 88.0%를 기록하여 이전 최고 성능 방법인 IDR보다 각각 0.9%와 3.3% 높았다.
- Oulu-CASIA NIR-VIS 데이터베이스에서 방법은 랭크-1 정확도 95.5%와 FAR=0.1%일 때 검증 정확도 60.7%를 달성하여 IDR의 94.3%와 46.2%를 각각 초월했다.
- 절단 실험 결과, 적대적 손실과 고차원 분산 이질성(CVD) 손실이 모두 필수적임을 확인하였다: 둘 중 하나를 제거하면 성능이 크게 떨어지며, 특히 낮은 FAR에서 두드러진다.
- 이 방법은 쌍화된 데이터가 제한된 상황에서 NIR 입력에서 사진 수준의 VIS 이미지를 생성하여 효과적인 교차 스펙트럼 환영화를 보여주며, 이중 경로 GAN 설계 덕분이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.