Skip to main content
QUICK REVIEW

[논문 리뷰] Super-FAN: Integrated facial landmark localization and super-resolution of real-world low resolution faces in arbitrary poses with GANs

Adrian Bulat, Georgios Tzimiropoulos|arXiv (Cornell University)|2017. 12. 07.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 실세계의 다양한 자세를 가진 저해상도 얼굴에 대해 종단간(end-to-end)으로 얼굴 초해상화와 특징점 위치 추정을 동시에 수행하는 GAN 기반 프레임워크인 Super-FAN을 제안한다. 잔차 기반 초해상화 아키텍처에 열매도 회귀(sub-network)와 새로운 열매도 손실을 통합함으로써 Super-FAN은 두 작업 모두에서 최신 기술 수준의 성능을 달성하며, 프ofile 및 가림이 있는 얼굴을 포함한 실세계 데이터에서 선명하고 세밀한 결과를 생성한다.

ABSTRACT

This paper addresses 2 challenging tasks: improving the quality of low resolution facial images and accurately locating the facial landmarks on such poor resolution images. To this end, we make the following 5 contributions: (a) we propose Super-FAN: the very first end-to-end system that addresses both tasks simultaneously, i.e. both improves face resolution and detects the facial landmarks. The novelty or Super-FAN lies in incorporating structural information in a GAN-based super-resolution algorithm via integrating a sub-network for face alignment through heatmap regression and optimizing a novel heatmap loss. (b) We illustrate the benefit of training the two networks jointly by reporting good results not only on frontal images (as in prior work) but on the whole spectrum of facial poses, and not only on synthetic low resolution images (as in prior work) but also on real-world images. (c) We improve upon the state-of-the-art in face super-resolution by proposing a new residual-based architecture. (d) Quantitatively, we show large improvement over the state-of-the-art for both face super-resolution and alignment. (e) Qualitatively, we show for the first time good results on real-world low resolution images.

연구 동기 및 목표

  • 모든 얼굴 자세에서 매우 저해상도의 실세계 얼굴에 대해 이미지 품질을 향상시키고 정확하게 특징점을 국정화하는 데 도전하는 것.
  • 기존 방법들이 합성 데이터나 정면, 사전 정렬된 얼굴에 의존하는 한계를 극복하는 것.
  • 특징점 검출과 이미지 복원을 공동 최적화함으로써 초해상화에 얼굴의 구조적 정보를 통합하는 것.
  • 초해상화와 얼굴 정렬의 공동 학습이 두 작업 모두에서 뛰어난 성능을 낼 수 있음을 보여주는 것.

제안 방법

  • Super-FAN은 잔차 아키텍처를 가진 GAN 기반 초해상화 네트워크를 사용하여 저해상도 얼굴 이미지를 향상시킨다.
  • 특수 설계된 서브넷은 얼굴 특징점 위치 추정을 위한 열매도 회귀를 수행하며, 구조적 감독을 제공한다.
  • 예측된 특징점 열매도를 사용해 초해상화 네트워크를 이끄는 새로운 열매도 손실을 도입한다.
  • 시각적 손실, 픽셀 단위의 L1 손실, 그리고 새로운 열매도 손실을 조합하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 데이터 증강에는 무작위 가우시안 블러, JPEG 아티팩트, 색상 왜곡이 포함되어 실세계 이미지에 대한 강인성을 향상시킨다.
  • 초해상화와 특징점 검출을 공동 최적화함으로써 상호 보완적인 성능 향상을 가능하게 한다.

실험 결과

연구 질문

  • RQ1임의의 자세를 가진 매우 저해상도의 실세계 얼굴에서 얼굴 초해상화와 특징점 위치 추정을 공동으로 학습하는 것이 성능 향상에 기여하는가?
  • RQ2열매도 감독을 통한 얼굴 구조적 정보 통합이 초해상화 품질 향상과 특징점 정확도 향상에 기여하는가?
  • RQ3합성 데이터나 정면 이미지로만 훈련된 최신 기술 수준의 방법들과 비교해 본다면, 제안된 방법은 실세계 데이터에서 어떻게 성능을 발휘하는가?
  • RQ4기존 손실 함수에 비해 새로운 열매도 손실이 정렬 및 이미지 복원 향상에 얼마나 기여하는가?
  • RQ5비구속 환경에서 극단적인 자세, 가림, 강한 블러 상황에서도 모델이 일반화 가능한가?

주요 결과

  • Super-FAN은 자세가 60°를 초과하는 얼굴에 대해 LS3D-W 데이터셋에서 67.0% AUC를 달성하여 기존 방법들을 크게 앞서간다.
  • 실세계 WiderFace 이미지에서 Super-FAN은 SR-GAN과 CBN보다 더 선명하고 세밀한 결과를 생성하며, 특히 도전적인 조건에서 뛰어난 성능을 보였다.
  • 열매도 손실을 추가함으로써 기준 모델(픽셀 및 특징 손실만 사용) 대비 특징점 정확도 AUC가 5.5%포인트 향상되었다.
  • 인위적으로 저해상도로 변환된 이미지로만 훈련된 경우에도, Super-FAN은 데이터 증강 후 실세계 데이터에서 재학습된 FAN 모델과 이중선형 보조 기반 모델을 모두 앞서는 성능을 보였다.
  • 자세가 60°를 초과하는 경우 LS3D-W 데이터셋에서 PSNR가 20.85로 나타나 자세 변화가 있음에도 강력한 성능을 보였다.
  • 실패 사례는 주로 극단적인 자세, 가림, 강한 블러로 인한 것으로, 이러한 왜곡에 대한 강인성 향상 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.