Skip to main content
QUICK REVIEW

[논문 리뷰] Cascaded Generation of High-quality Color Visible Face Images from Thermal Captures

Naser Damer, Fadi Boutros|arXiv (Cornell University)|2019. 10. 21.
Face recognition and analysis참고 문헌 21인용 수 10
한 줄 요약

이 논문은 대규모 데이터셋, 데이터 증강, 또는 투명도 센서가 필요 없이 열화상 촬영에서 고품질의 색채 가시 얼굴 영상을 생성하기 위해 문맥 손실을 갖춘 계단식 개선 네트워크(CRN)를 제안한다. 이 방법은 다양한 자세, 가림, 조명 조건에서 최신 기술 수준의 시각적 품질과 지표상의 유사도를 달성하며, 두 가지 최신 기술 방법보다 성능이 뛰어나다.

ABSTRACT

Generating visible-like face images from thermal images is essential to perform manual and automatic cross-spectrum face recognition. We successfully propose a solution based on cascaded refinement network that, unlike previous works, produces high quality generated color images without the need for face alignment, large databases, data augmentation, polarimetric sensors, computationally-intense training, or unrealistic restriction on the generated resolution. The training of our solution is based on the contextual loss, making it inherently scale (face area) and rotation invariant. We present generated image samples of unknown individuals under different poses and occlusion conditions.We also prove the high similarity in image quality between ground-truth images and generated ones by comparing seven quality metrics. We compare our results with two state-of-the-art approaches proving the superiority of our proposed approach.

연구 동기 및 목표

  • 교차 스펙트럼 얼굴 인식을 위해 열화상 촬영에서 고품질의 색채 가시 얼굴 영상 생성을 가능하게 하기 위해.
  • 대규모 데이터셋, 데이터 증강, 투명도 센서, 또는 계산 비용이 큰 학습이 필요한 이전 방법의 한계를 극복하기 위해.
  • 자세 변화, 가림, 저조도와 같은 도전적인 조건에서도 시각적으로 현실적이며 정량적으로 정확한 가시 영상을 생성하기 위해.
  • 추론 시 얼굴 정렬이 필요 없이 척도 및 회전 불변성을 확보하기 위해.
  • 시각적 품질과 영상 충실도 지표에서 두 가지 최신 기술 방법보다 뛰어난 성능을 입증하기 위해.

제안 방법

  • 이 방법은 다중 해상도 개선 모듈을 갖춘 계단식 개선 네트워크(CRN)를 사용하며, 저해상도(4×4)에서 시작하여 점차 목표 해상도(128×128)로 확대한다.
  • 각 개선 모듈은 입력, 중간, 출력의 세 단계로 구성되어 있어 최소한의 파라미터로 효율적인 다중 해상도 특징 학습이 가능하다.
  • 학습은 깊은 특징 표현의 유사성을 강제하는 문맥 손실에 의해 이뤄지며, 이로 인해 방법이 본질적으로 척도 및 회전 불변성을 갖게 된다.
  • 이 방법은 영상 정렬, 데이터 증강, 투명도 센서가 필요 없어, 대규모 또는 특수 목적의 데이터셋에 대한 의존도를 줄인다.
  • 모델은 비교적 소규모 데이터셋에서 엔드 투 엔드로 학습되며, 문맥 손실의 불변성 덕분에 강력한 성능을 달성한다.

실험 결과

연구 질문

  • RQ1대규모로 정렬된 학습 데이터셋이나 데이터 증강이 필요 없이 열화상 촬영에서 고품질의 색채 가시 얼굴 영상을 생성할 수 있는가?
  • RQ2자세 및 가림 변화 조건에서 제안된 CRN와 문맥 손실이 GAN 기반 방법에 비해 시각적 품질과 영상 충실도에서 어떻게 비교되는가?
  • RQ3기준 가시 영상과 비교했을 때 선명도, 대비, 밝기 등의 영상 품질 지표를 얼마나 잘 유지하는가?
  • RQ4명시적인 정렬이나 감독 없이도 새로운 개인, 자세, 가림 조건에 일반화 가능한가?
  • RQ5문맥 손실이 생성된 영상에서 척도 및 회전 불변성에 어떻게 기여하는가?

주요 결과

  • 제안된 방법은 다양한 자세, 표정, 가림 유형(안경, 선글라스, 헤드웨어, 손 가림 등)에서 열화상 입력으로부터 시각적으로 현실적인 색채 가시 얼굴 영상을 생성한다.
  • 큰 스케일의 잡음은 거의 없으며, 특히 비면상 자세에서 눈 주변과 같은 미세한 디테일에서 약간의 결함만 존재한다.
  • 일곱 가지 영상 품질 지표를 사용한 정량적 분석 결과, 생성된 영상과 기준 영상 간의 유사도가 매우 높으며, 생성된 영상가 약간 더 흐리고 밝지만 대비와 GCF가 더 높다.
  • 문맥 손실 덕분에 척도 및 회전 불변성이 가능해, 추론 시 영상 정렬이 필요 없이 일반화 성능을 확보할 수 있다.
  • 시각적 품질과 지표 유사도 모두에서 두 가지 최신 기술 기반 모델(TV-GAN 및 PIX2PIX)을 뛰어넘었으며, 더 낮은 LS 값으로 더 우수한 조명 대칭성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.