Skip to main content
QUICK REVIEW

[논문 리뷰] Geometry-Aware Face Completion and Editing

Linsen Song, Jie Cao|arXiv (Cornell University)|2018. 09. 09.
Face recognition and analysis참고 문헌 34인용 수 5
한 줄 요약

이 논문은 유추된 얼굴 랜드마크 히트맵과 파싱 맵을 활용하여 고해상도 이미지 생성을 안내하는 기하학적 인식(face completion 및 편집) 프레임워크인 FCENet을 제안한다. 얼굴 기하학 추정기, 분리 가능한 마스크 인식 생성기, 그리고 저랭크 정규화를 통합함으로써 FCENet는 복잡한 가림을 가진 상황에서도 최신 기술 수준(SOTA)의 성능을 달성하면서도 기하학적 조작을 통한 얼굴 속성의 상호작용 편집을 가능하게 한다.

ABSTRACT

Face completion is a challenging generation task because it requires generating visually pleasing new pixels that are semantically consistent with the unmasked face region. This paper proposes a geometry-aware Face Completion and Editing NETwork (FCENet) by systematically studying facial geometry from the unmasked region. Firstly, a facial geometry estimator is learned to estimate facial landmark heatmaps and parsing maps from the unmasked face image. Then, an encoder-decoder structure generator serves to complete a face image and disentangle its mask areas conditioned on both the masked face image and the estimated facial geometry images. Besides, since low-rank property exists in manually labeled masks, a low-rank regularization term is imposed on the disentangled masks, enforcing our completion network to manage occlusion area with various shape and size. Furthermore, our network can generate diverse results from the same masked input by modifying estimated facial geometry, which provides a flexible mean to edit the completed face appearance. Extensive experimental results qualitatively and quantitatively demonstrate that our network is able to generate visually pleasing face completion results and edit face attributes as well.

연구 동기 및 목표

  • 복잡한 가림 상황에서 의미적으로 일관되고 시각적으로 현실적인 얼굴 보완을 생성하는 데 도전한다.
  • 랜드마크 히트맵과 파싱 맵과 같은 얼굴 기하학 사전 지식을 종합적인 딥러닝 프레임워크에 통합하여 보완 정확도를 향상시킨다.
  • 유추된 얼굴 기하학 이미지를 수정하여 얼굴 속성(예: 눈 크기, 입 모양 등)을 상호작용적으로 편집할 수 있도록 한다.
  • 저랭크 제약 조건을 사용하여 손상된 얼굴 이미지의 마스크 영역을 분리하고 정규화함으로써 다양한 가림 형태와 크기에서의 일반화 능력을 향상시킨다.

제안 방법

  • 마스크가 씌워진 얼굴 이미지에서 얼굴 랜드마크 히트맵과 파싱 맵을 예측할 수 있도록 얼굴 기하학 추정기를 훈련시켜 보완에 필요한 기하학적 사전 지식을 제공한다.
  • 조건부 인코더-디코딩 아키텍처를 사용하는 생성기가 마스크가 씌워진 이미지와 추정된 기하학 정보를 입력으로 받아 완전한 얼굴을 재구성하고 마스크 영역을 분리한다.
  • 분리된 마스크 행렬에 저랭크 정규화 항을 적용하여 실제 마스크와의 구조적 유사성을 강제로 유지함으로써 다양한 가림 형태에 대한 강건성을 향상시킨다.
  • 전역 및 국소 두 개의 판별기를 사용한 GAN 프레임워크를 통해 생성된 얼굴 이미지의 현실감을 향상시킨다.
  • 생성기의 입력으로 들어가는 얼굴 기하학 이미지를 수정함으로써 상호작용 편집을 가능하게 한다(예: 입 영역 교체).
  • 적대적 손실, 인지적 손실, 저랭크 마스크 정규화를 포함한 엔드 투 엔드 훈련을 통해 네트워크를 학습시킨다.

실험 결과

연구 질문

  • RQ1랜드마크 히트맵과 파싱 맵과 같은 얼굴 기하학 사전 지식이 기준 모델 대비 얼굴 보완 품질을 크게 향상시킬 수 있는가?
  • RQ2분리된 마스크에 저랭크 정규화를 적용할 경우 다양한 가림 형태와 크기에서 성능 향상 정도는 어느 정도인가?
  • RQ3동일한 모델이 기하학 입력을 수정함으로써 얼굴 보완과 얼굴 속성의 상호작용 편집을 동시에 지원할 수 있는가?
  • RQ4랜드마크 히트맵과 파싱 맵을 함께 사용할 경우, 각각을 별도로 사용할 때보다 보완 품질에서 어떤 차이가 있는가?

주요 결과

  • FCENet는 Multi-PIE 데이터셋에서 랜드마크 히트맵과 파싱 맵을 모두 사용하고 저랭크 정규화를 적용했을 때 PSNR 27.714, SSIM 0.904를 기록하며, 모든 아블레이션 설정보다 뛰어난 성능을 보였다.
  • 아블레이션 연구 결과, 기하학 정보(랜드마크 또는 파싱 맵)를 추가함으로써 기준 모델 대비 PSNR가 최대 2.788 향상되고 SSIM이 최대 0.063 향상되었다.
  • 저랭크 정규화를 적용함으로써 기준 모델 대비 PSNR가 0.544 향상되고 SSIM이 0.004 향상되었다.
  • 시각적 결과는 FCENet가 PM, SII, CE, GFC보다 더 현실적이고 맥락적으로 일관된 얼굴을 생성함을 보여주며, 특히 눈이나 모자로 가려진 경우와 같은 도전적인 케이스에서 뛰어난 성능을 보였다.
  • 이 방법은 오직 기하학 입력만 수정함으로써 눈 크기, 입 모양, 코 너비 등의 얼굴 속성을 민감하게 유연하게 편집할 수 있으며, 다른 속성에는 최소한의 영향을 미친다.
  • 프레임워크는 복잡한 마스크를 손상된 입력에서 효과적으로 분리하고, 큰 또는 비정형 가림 상황에서도 높은 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.