Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Warped Guidance for Blind Face Restoration

Xiaoming Li, Ming Liu|arXiv (Cornell University)|2018. 04. 13.
Facial Nerve Paralysis Treatment and Research인용 수 9
한 줄 요약

이 논문은 흐름 필드 예측 네트워크(WarpNet)를 통해 정렬된 가이드 이미지를 사용하는 가이드드 페이스 복원 네트워크인 GFRNet을 제안한다. 이는 블라인드 페이스 복원 성능을 향상시킨다. 랜드마크 손실과 총 변동성 정규화를 도입하여 지도 없는 흐름 필드로 WarpNet을 훈련시킴으로써, 합성 및 실제 저품질 얼굴 이미지에서 최신 기술 수준(SOTA)의 성능을 달성하며, 선명하고 신원 인식 가능한 세부 사항을 갖춘 사진 수준의 결과를 생성한다.

ABSTRACT

This paper studies the problem of blind face restoration from an unconstrained blurry, noisy, low-resolution, or compressed image (i.e., degraded observation). For better recovery of fine facial details, we modify the problem setting by taking both the degraded observation and a high-quality guided image of the same identity as input to our guided face restoration network (GFRNet). However, the degraded observation and guided image generally are different in pose, illumination and expression, thereby making plain CNNs (e.g., U-Net) fail to recover fine and identity-aware facial details. To tackle this issue, our GFRNet model includes both a warping subnetwork (WarpNet) and a reconstruction subnetwork (RecNet). The WarpNet is introduced to predict flow field for warping the guided image to correct pose and expression (i.e., warped guidance), while the RecNet takes the degraded observation and warped guidance as input to produce the restoration result. Due to that the ground-truth flow field is unavailable, landmark loss together with total variation regularization are incorporated to guide the learning of WarpNet. Furthermore, to make the model applicable to blind restoration, our GFRNet is trained on the synthetic data with versatile settings on blur kernel, noise level, downsampling scale factor, and JPEG quality factor. Experiments show that our GFRNet not only performs favorably against the state-of-the-art image and face restoration methods, but also generates visually photo-realistic results on real degraded facial images.

연구 동기 및 목표

  • 이상화 유형(흐림, 노이즈, 압축, 저해상도 등)이 알려지지 않은 상태에서 복원하는 블라인드 페이스 복원 문제를 해결한다.
  • 가이드 이미지와 복원 대상 이미지의 자세, 표정, 조명이 다를 경우 표준 CNN이 신원 인식 가능한 얼굴 세부 사항을 유지하는 데 한계가 있음을 극복한다.
  • 입력 이미지와 가이드 이미지 간의 정렬 불일치를 다룰 수 있는 통합 프레임워크를 개발하여 고품질 가이드 이미지를 활용해 복원 품질을 향상시킨다.
  • 지상 진술 흐름 필드 없이도 워핑 네트워크의 엔드 투 엔드 훈련을 가능하게 하기 위해 랜드마크 손실과 총 변동성 정규화를 도입한다.
  • 실제 세계의 복잡하고 알려지지 않은 이상화에 대해 강건성을 확보하기 위해 일반 이상화 모델을 기반으로 모델을 훈련시킨다.

제안 방법

  • 두 가지 브랜치로 구성된 네트워크를 제안: WarpNet은 가이드 이미지를 복원 대상 관측 이미지의 자세와 표정에 맞게 정렬하기 위해 흐름 필드를 예측한다.
  • 복원 하위 네트워크(RecNet)를 사용하여 복원 대상 이미지와 워핑된 가이드 이미지를 입력으로 받아 최종 고품질 얼굴 이미지를 생성한다.
  • 지상 진술 흐름 필드 없이도 WarpNet을 훈련하기 위해 예측된 얼굴 키포인트 위치를 지상 진술 위치로 회귀시키는 랜드마크 손실을 도입한다.
  • 예측된 흐름 필드에 총 변동성(TV) 정규화를 적용하여 공간적 매끄러움을 확보하고 비현실적인 워핑을 방지한다.
  • 재구성 손실(L1/L2)과 적대적 손실을 사용하여 전체 GFRNet을 훈련시켜 감각적 품질과 현실감을 향상시킨다.
  • 실제 세계 조건을 시뮬레이션하기 위해 블러, 다운샘플링, AWGN, JPEG 압축을 조합한 일반 이상화 모델을 사용해 다양한 훈련 데이터를 합성한다.

실험 결과

연구 질문

  • RQ1가이드 이미지와 복원 대상 이미지의 자세, 표정, 조명이 크게 다를 경우, 가이드 이미지를 활용해 블라인드 페이스 복원 성능을 향상시킬 수 있는가?
  • RQ2지상 진술 흐름 필드 없이도 얼굴 복원에서 이미지 정렬을 위한 워핑 네트워크를 효과적으로 훈련시킬 수 있는가?
  • RQ3지상 진술이 없는 상황에서 정확하고 매끄러운 흐름 필드를 학습하기 위해 어떤 감독 신호(예: 랜드마크 손실, TV 정규화)가 가장 효과적인가?
  • RQ4직접 정렬되지 않은 가이드 이미지와 복원 대상 이미지를 융합하는 것과 비교해 워핑 하위 네트워크를 통합함으로써 복원 품질이 유의미하게 향상되는가?
  • RQ5합성 이상화 데이터로 훈련된 모델이 실제 세계에서의 복잡하고 알려지지 않은 이상화에 일반화되는가?

주요 결과

  • WarpNet, 흐름 손실, 랜드마크 감독이 모두 포함된 GFRNet(Full) 버전이 PSNR와 감각적 품질 모두에서 모든 변형 및 최신 기술 수준의 방법을 압도한다.
  • 제거 실험 결과, WarpNet과 랜드마크 손실이 모두 필수적임을 확인: 둘 중 하나를 제거하면 특히 자세와 표정 정렬 성능이 크게 떨어진다.
  • Ours(Full)는 VggFace2에서 8배 슈퍼레졸루션을 포함한 모든 벤치마크에서 최고의 PSNR와 SSIM 성능을 기록하며, 기준선 대비 더 선명하고 현실적인 결과를 생성한다.
  • 블러, 노이즈, 다운샘플링, JPEG 압축을 포함한 전체 이상화 모델로 훈련된 모델이 실제 저품질 이미지에 가장 잘 일반화되며, 아티팩트 없고 선명한 출력을 생성한다.
  • 임의의(정렬되지 않은) 가이드 이미지를 사용한 Ours(R)도 두 번째로 높은 성능을 기록하여 신원 불일치에 대해 강건함을 보이며, 다만 잘못된 세부 사항을 유도할 수 있다.
  • 시각적 비교 결과, Ours(Full)는 Ours(-F)보다 훨씬 더 잘 정렬된 워핑된 가이드 이미지를 생성함으로써 흐름 손실이 안정적이고 정확한 워핑을 위해 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.