[논문 리뷰] TV-GAN: Generative Adversarial Network Based Thermal to Visible Face Recognition
이 논문은 열화상 얼굴 이미지를 가시광선 유사 이미지로 변환하면서도 신원 정보를 유지하는 TV-GAN이라는 생성적 적대적 네트워크를 제안한다. 이를 통해 사전에 트레이닝된 가시광선 얼굴 인식 모델을 직접 사용할 수 있다. 생성자에 의해 학습된 닫힌 집합 얼굴 인식 손실를 디스커미네이터에 통합함으로써, TV-GAN은 기준 GAN보다 더 나은 신원 유지 성능을 보이며, 제한된 훈련 데이터 조건에서도 최신 기술 수준의 성능을 달성한다.
This work tackles the face recognition task on images captured using thermal camera sensors which can operate in the non-light environment. While it can greatly increase the scope and benefits of the current security surveillance systems, performing such a task using thermal images is a challenging problem compared to face recognition task in the Visible Light Domain (VLD). This is partly due to the much smaller amount number of thermal imagery data collected compared to the VLD data. Unfortunately, direct application of the existing very strong face recognition models trained using VLD data into the thermal imagery data will not produce a satisfactory performance. This is due to the existence of the domain gap between the thermal and VLD images. To this end, we propose a Thermal-to-Visible Generative Adversarial Network (TV-GAN) that is able to transform thermal face images into their corresponding VLD images whilst maintaining identity information which is sufficient enough for the existing VLD face recognition models to perform recognition. Some examples are presented in Figure 1. Unlike the previous methods, our proposed TV-GAN uses an explicit closed-set face recognition loss to regularize the discriminator network training. This information will then be conveyed into the generator network in the forms of gradient loss. In the experiment, we show that by using this additional explicit regularization for the discriminator network, the TV-GAN is able to preserve more identity information when translating a thermal image of a person which is not seen before by the TV-GAN.
연구 동기 및 목표
- 도메인 갭과 제한된 데이터로 인한 열화상 얼굴 인식의 낮은 성능 문제를 해결하기 위해.
- 재학습 없이도 사전에 트레이닝된 가시광선 도메인(VLD) 얼굴 인식 모델을 열화상 이미지에 직접 적용할 수 있도록 하기 위해.
- 명시적 감독을 통해 열화상에서 가시광선으로의 이미지 변환 과정에서의 신원 유지 성능을 향상시키기 위해.
- 신원 정규화를 통한 적대적 학습을 통해 열화상 및 가시광선 얼굴 이미지 간의 도메인 갭을 줄이기 위해.
제안 방법
- 조건부 GAN 프레임워크를 사용하며, 생성자는 열화상 이미지를 가시광선 유사 이미지로 매핑한다.
- 디스커미네이터는 이중 기능을 수행한다: 실제/가짜 이미지 분류 및 닫힌 집합 얼굴 인식.
- 닫힌 집합 얼굴 인식 손실는 디스커미네이터에 통합되어 기울기 흐름을 통해 생성자로 역전파된다.
- 생성자는 적대적 손실 및 신원 유지 손실를 모두 최소화하도록 훈련되어 특징 일致성을 향상시킨다.
- 쌍체 훈련 데이터(열화상 및 가시광선 얼굴 이미지)를 사용하여 번역 함수를 학습한다.
- VGG 기반의 인지 손실(예: VGG 기반)에 의존하지 않고 명시적 신원 감독을 사용함으로써 훈련 비용을 절감한다.
실험 결과
연구 질문
- RQ1GAN 기반의 이미지 번역 모델이 열화상 입력만으로도 가시광선 도메인에서 정확한 얼굴 인식을 가능하게 할 정도로 충분한 신원 정보를 유지할 수 있는가?
- RQ2디스커미네이터에 닫힌 집합 얼굴 인식 손실를 통합함으로써, 인지 기반 손실 대비 신원 유지 성능이 어떻게 향상되는가?
- RQ3제한된 데이터 조건에서 기존의 GAN 기반 및 패치 기반 방법에 비해 제안된 TV-GAN이 더 우수한 성능을 보일 수 있는가?
- RQ4훈련에서 제외된 요소들(예: 안경 착용)을 가진 새로운 신원에 대해 테스트했을 때, 이 방법의 내성은 얼마나 강건한가?
주요 결과
- TV-GAN은 피크스2픽스(Pix2Pix)를 포함한 모든 비교 모델보다 프로토콜 A(사람당 1장의 가시광선 이미지) 및 프로토콜 B(사람당 4장의 가시광선 이미지)에서 랭크-1 정확도 측면에서 모두 슈퍼리어 성능을 보였다.
- 프로토콜 A에서 TV-GAN은 랭크-1 정확도 24.08%를 달성했으며, 순수 열화상 기준선(12.57%)과 피크스2픽스(7.85%)보다 뚜렷이 뛰어났다.
- 프로토콜 B에서 TV-GAN은 랭크-3 정확도 31.41%를 기록했으며, 순수 열화상 방법(랭크-3 46.07%, 하지만 랭크-1는 낮음)과 피크스2픽스(랭크-3 36.13%)를 모두 초월했다.
- 훈련에서 제외된 안경 착용자에 대해 테스트했을 때, TV-GAN은 순수 열화상 기준선보다도 더 나은 성능을 보였지만, 성능 저하가 발생하여 새로운 속성에 민감함을 보였다.
- 제거 실험 결과, 충분한 훈련 데이터가 없을 경우, TV-GAN과 같은 GAN 기반 방법조차도 순수 열화상 기준선보다 성능이 열 劣함을 입증하며, 데이터 부족이 핵심 과제임을 시사했다.
- 시각화 결과는 TV-GAN이 기준선 방법보다 더 현실적이며 신원 일致성이 높은 얼굴을 생성하는 것으로 나타났지만, 인종이나 연령 같은 속성을 종종 유지하지 못하는 경우가 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.