Skip to main content
QUICK REVIEW

[논문 리뷰] A Free Viewpoint Portrait Generator with Dynamic Styling.

Anpei Chen, Ruiyang Liu|arXiv (Cornell University)|2020. 07. 07.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 5
한 줄 요약

이 논문은 3D 인식적 형태 표현을 위한 의미적 점유 필드(SOF)와 지역 스타일 제어를 위한 의미적 인스턴스별(SIW) StyleGAN을 사용하여 기하학적 구조와 텍스처 공간을 분리하는 자유 시점 포트레이트 생성기를 제안한다. 664개의 3D 포트레이트 스캔과 실사 이미지(FFHQ/CelebA-HQ)를 훈련 데이터로 사용함으로써, 자세, 시점, 지역 스타일에 대한 분리된, 외형 일관성을 유지하는 편집 기능을 가능하게 하며, 제어 가능성과 일반화 능력에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Generating portrait images from a single latent space facing the problem of entangled attributes, making it difficult to explicitly adjust the generation on specific attributes, e.g., contour and viewpoint control or dynamic styling. Therefore, we propose to decompose the generation space into two subspaces: geometric and texture space. We first encode portrait scans with a semantic occupancy field (SOF), which represents semantic-embedded geometry structure and output free-viewpoint semantic segmentation maps. Then we design a semantic instance wised(SIW) StyleGAN to regionally styling the segmentation map. We capture 664 3D portrait scans for our SOF training and use real capture photos(FFHQ and CelebA-HQ) for SIW StyleGAN training. Adequate experiments show that our representations enable appearance consistent shape, pose, regional styles controlling, achieve state-of-the-art results, and generalize well in various application scenarios.

연구 동기 및 목표

  • 단일 잠재 공간 기반의 포트레이트 생성에서 속성의 엔트레인먼트 문제를 해결하여 기하학적 구조와 스타일에 대한 명시적 제어를 가능하게 하기 위해.
  • 3D 인식적 의미 기하학을 모델링하여 다양한 시점에서 외형 일관성을 유지하는 자유 시점 생성을 가능하게 하기 위해.
  • 기하학적 구조에서 텍스처 조작을 분리함으로써 지역 스타일 편집을 실현하기 위해.
  • 다양한 응용 시나리오에 일반화되는 강력한 포트레이트 생성 시스템을 훈련하기 위해.

제안 방법

  • 664개의 3D 포트레이트 스캔 데이터를 기반으로 의미적 임베딩을 가진 3D 기하학을 표현하고 자유 시점 의미 분할 맵을 생성하기 위해 의미적 점유 필드(SOF)를 훈련한다.
  • 실사 포트레이트 사진(FFHQ 및 CelebA-HQ)을 사용하여 각 영역에 맞는 스타일 전이를 적용할 수 있는 의미적 인스턴스별(SIW) StyleGAN을 훈련한다.
  • 생성 공간을 두 개의 하위공간으로 분해한다: SOF를 통한 기하학적 공간과 SIW StyleGAN을 통한 텍스처 공간으로서, 분리된 제어를 실현한다.
  • 입력 스캔을 SOF에 인코딩하여 3D 기반 의미 맵을 생성하고, 이 맵을 인스턴스 인식 잠재 코드를 사용한 SIW StyleGAN으로 스타일링한다.
  • SOF의 3D 일관성을 활용하여 시점과 자세 변화를 가능하게 하면서도 외형의 정확성을 유지한다.
  • SOF의 기하학적 표현과 SIW StyleGAN의 지역 스타일 조절 기능을 조합하여 세밀한 제어가 가능한 포트레이트 생성을 실현한다.

실험 결과

연구 질문

  • RQ1기하학적 구조와 텍스처의 분리된 표현이 포트레이트 생성에서 시점과 윤곽에 대한 명시적 제어를 가능하게 할 수 있는가?
  • RQ2StyleGAN 아키텍처 내에서 인스턴스별 잠재 코드를 사용할 경우 지역 스타일 편집이 얼마나 효과적으로 구현될 수 있는가?
  • RQ3SOF 기반의 기하학적 표현이 자유 시점 간의 형태 일관성을 어느 정도 유지하는가?
  • RQ4기존 방법과 비교해 볼 때 제안된 방법은 다양한 포트레이트 생성 시나리오에서 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 방법은 자세와 시점에 대한 명시적 제어 기능을 갖춘 자유 시점 포트레이트 생성에서 최신 기술 수준의 성능을 달성한다.
  • 3D 인식적 SOF 기반의 의미 기하학 표현 덕분에 다양한 시점에서의 외형 일관성이 크게 향상된다.
  • SIW StyleGAN을 통해 지역 스타일 편집이 효과적으로 가능해져 헤어 컬러나 의류 텍스처와 같은 국소적 속성의 조작이 가능해진다.
  • 모델은 다양한 응용 시나리오, 예를 들어 미리 보지 못한 자세나 조명 조건에서도 잘 일반화된다.
  • SOF 훈련을 위한 664개의 3D 스캔과 SIW 훈련을 위한 실사 이미지(FFHQ/CelebA-HQ)의 조합이 고해상도이고 제어 가능한 생성을 가능하게 한다.
  • 정량적 및 정성적 결과를 통해 기존 기준 방법에 비해 뛰어난 분리도와 편집 능력이 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.