Skip to main content
QUICK REVIEW

[논문 리뷰] SD-GAN: Structural and Denoising GAN reveals facial parts under occlusion

Samik Banerjee, Sukhendu Das|arXiv (Cornell University)|2020. 02. 19.
Face recognition and analysis참고 문헌 33인용 수 5
한 줄 요약

이 논문은 구조적 GAN과 노이즈 제거 GAN을 조합하여 가림된 얼굴 부분을 복원하는 새로운 생성적 적대적 네트워크인 SD-GAN을 제안한다. 이는 이중 모드 학습 전략과 새로운 구조적 손실(SIM + 패치 기반 MSE)을 사용한다. 이 방법은 GFC 및 TPG-GAN과 같은 이전 방법들보다 더 빠른 수렴 속도와 뛰어난 이미지 품질을 보이며, 가림된 데이터셋에서 최신 기술 수준의 얼굴 인식 성능을 달성한다.

ABSTRACT

Certain facial parts are salient (unique) in appearance, which substantially contribute to the holistic recognition of a subject. Occlusion of these salient parts deteriorates the performance of face recognition algorithms. In this paper, we propose a generative model to reconstruct the missing parts of the face which are under occlusion. The proposed generative model (SD-GAN) reconstructs a face preserving the illumination variation and identity of the face. A novel adversarial training algorithm has been designed for a bimodal mutually exclusive Generative Adversarial Network (GAN) model, for faster convergence. A novel adversarial "structural" loss function is also proposed, comprising of two components: a holistic and a local loss, characterized by SSIM and patch-wise MSE. Ablation studies on real and synthetically occluded face datasets reveal that our proposed technique outperforms the competing methods by a considerable margin, even for boosting the performance of Face Recognition.

연구 동기 및 목표

  • 특히 중요한 얼굴 특징가 가림된 경우에도 얼굴 인식 문제를 해결하기 위해.
  • 후처리 없이도 손실된 얼굴 부분을 복원하는 종단 간 생성 모델을 개발하기 위해.
  • 이중 모드 학습 전략을 도입하여 얼굴 인painting의 수렴 속도와 이미지 품질을 향상시키기 위해.
  • SSIM과 PMSE를 조합한 새로운 구조적 손실 함수를 통해 전체적 및 국소적 얼굴 구조의 유지 향상하기 위해.
  • SD-GAN이 가림된 상황에서 얼굴 인식 시스템의 사전 처리 모듈로 효과적으로 사용될 수 있음을 입증하기 위해.

제안 방법

  • SD-GAN는 이중 모드 학습 과정을 사용한다: 모드-I는 환경 조명을 반영한 얼굴 이미지를 생성하고, 모드-II는 노이즈 제거 오토인코더 기반 생성자로 출력을 노이즈 제거한다.
  • 구조적 유사도(SSIM)를 통해 전체 얼굴 구조를, 패치 기반 평균 제곱 오차(PMSE)를 통해 국소 픽셀 수준의 정확성을 확보하는 새로운 적대적 구조적 손실이 도입된다.
  • 생성자는 최소화되는 구조적 손실과 동시에 디스크림이너를 속이는 미니맥스 게임을 통해 현실적이고 신원을 유지하는 얼굴 복원을 추구한다.
  • 두 번째 모드에서 노이즈 제거 오토인코더 아키텍처를 활용하여 나시 균형에 더 빠른 수렴을 위한 학습 알고리즘이 설계된다.
  • 실제 및 합성적으로 가로막힌 얼굴 데이터셋(AR, CelebA, Multi-PIE 포함)에서 종단 간으로 모델을 훈련한다.
  • 프레임워크는 얼굴 인식을 위한 사전 처리 단계로 평가되며, 성능 향상을 평가하기 위해 VGG를 분류기로 사용한다.

실험 결과

연구 질문

  • RQ1생성 모델은 신원과 조명 변화를 유지하면서도 가려진 얼굴 부분을 복원할 수 있는가?
  • RQ2제안된 이중 모드 학습 전략은 기존의 얼굴 인painting GAN보다 더 빠른 수렴을 이끌어낼 수 있는가?
  • RQ3새로운 구조적 손실(SIM + PMSE)은 재구성된 얼굴의 전반적 얼굴 구조와 국소 텍스처 정확성을 향상시킬 수 있는가?
  • RQ4GFC 및 TPG-GAN과 같은 최신 기술 수준의 방법들과 비교해 SD-GAN은 가림된 데이터셋에서 얼굴 인식 정확도 측면에서 어떻게 성능을 내는가?
  • RQ5SD-GAN는 후처리 없이도 얼굴 인식 시스템의 효과적인 사전 처리 모듈로 사용될 수 있는가?

주요 결과

  • AR 데이터베이스에서 VGG+SD-GAN는 AR1에서 랭크-1 인식률 96.82%를 기록했고, AR2에서는 92.64%를 달성하여 ISV(45.13% 및 39.81%)와 LDA-IR(62.59% 및 57.44%)를 크게 앞서며 뚜렷한 성능 향상을 보였다.
  • AR 데이터베이스에서 SD-GAN는 550 에포크 내에 수렴했으며, 에포크당 3분이 소요되었고, GFC는 30,000 에포크, 에포크당 8분이 소요되어 훈련 시간이 크게 단축됨을 보였다.
  • 90도 자세 변화가 있는 Multi-PIE 데이터셋에서 SD-GAN는 랭크-1 인식률 65.19%를 기록하여 TPG-GAN의 64.03%를 초월했다.
  • SD-GAN의 PSNR와 SSIM 값은 각각 19.84와 0.66였고, TPG-GAN는 12.26와 0.59였으며, 이는 더 뛰어난 이미지 품질을 의미한다.
  • 정성적 결과에서는 SD-GAN가 올바른 조명과 대칭성을 유지하며, TPG-GAN에서 관찰된 거울 효과 왜곡이나 부가적인 특징(예: 귀걸이)과 같은 잡음 요소를 피하고 있음을 확인했다.
  • 제거 실험 결과는 구조적 손실에서 SSIM과 PMSE의 조합이 재구성 품질과 인식 성능 향상에 뚜렷한 기여를 한다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.