Skip to main content
QUICK REVIEW

[논문 리뷰] IDE-3D: Interactive Disentangled Editing for High-Resolution 3D-aware Portrait Synthesis

Jingxiang Sun, Xuan Wang|arXiv (Cornell University)|2022. 05. 31.
Generative Adversarial Networks and Image Synthesis인용 수 13
한 줄 요약

IDE-3D는 실시간으로 고해상도의 3D 인식 포트레이트 합성 시스템을 제안하며, 하이브리드 GAN 역전치와 캐논리컬 에디터를 통해 상호작용 가능하고 분리된 얼굴 형태와 텍스처 편집을 가능하게 한다. 3D 의미 인식 기반의 StyleGAN2 생성자와 시야 일관성 있는 트리플레인 렌더링, 최적화된 잠재 공간 역전치를 조합함으로써, 다각도 및 지역 수준의 편집 작업에서 최신 기술 수준의 사진적 사실성, 충실도, 편집 가능성과 함께 시야 일관성을 유지한다.

ABSTRACT

Existing 3D-aware facial generation methods face a dilemma in quality versus editability: they either generate editable results in low resolution or high-quality ones with no editing flexibility. In this work, we propose a new approach that brings the best of both worlds together. Our system consists of three major components: (1) a 3D-semantics-aware generative model that produces view-consistent, disentangled face images and semantic masks; (2) a hybrid GAN inversion approach that initialize the latent codes from the semantic and texture encoder, and further optimized them for faithful reconstruction; and (3) a canonical editor that enables efficient manipulation of semantic masks in canonical view and product high-quality editing results. Our approach is competent for many applications, e.g. free-view face drawing, editing, and style control. Both quantitative and qualitative results show that our method reaches the state-of-the-art in terms of photorealism, faithfulness, and efficiency.

연구 동기 및 목표

  • 3D 인식 포트레이트 합성에서 사진적 사실성과 편집 가능성 사이의 상충 관계를 해결하기 위해.
  • 시야 일관성을 유지하면서도 실시간으로 상호작용 가능한 얼굴 특성(예: 헤어스타일, 표정, 액세서리 등)을 편집할 수 있도록 하기 위해.
  • 최적화 기반 GAN 역전치의 한계를 극복하기 위해, 이는 느리고 상호작용 사용에 비실용적이다.
  • 3D 공간에서 형태와 텍스처 의미를 분리하여 세밀한 지역 수준의 편집을 가능하게 하기 위해.
  • 다중 시야 감독 없이도 고정밀도 재구성과 편집을 달성하기 위해.

제안 방법

  • 다중 헤드 기반의 StyleGAN2 특징 생성자가 浅층 및 깊은 층에서 형태와 텍스처 코드를 주입하여 분리된 3D 인식 특징을 생성한다.
  • 이 특징들은 공간적으로 정렬된 트리플레인 표현으로 인코딩되어 형태와 텍스처의 효율적인 3D 볼륨 구축을 가능하게 한다.
  • 2D CNN 기반의 업샘플러는 신경 볼륨 렌더링을 통해 고해상도의 시야 일관성 있는 포트레이트를 렌더링한다.
  • 하이브리드 GAN 역전치 방법은 의미 및 텍스처 인코더를 사용해 잠재 코드를 초기화한 후, 핵심 편향 조정을 통해 고정밀 재구성을 정밀하게 개선한다.
  • 캐논리컬 에디터는 캐논리컬 시야 의미 마스크에 대한 사용자 편집을 잠재 공간으로 매핑함으로써 재역전치 없이 실시간 편집을 가능하게 한다.
  • 학습 중에 다중 시야 증강을 활용하여 시야 일관성을 향상시키고 자가 가림 현상에 의한 잡음을 감소시킨다.

실험 결과

연구 질문

  • RQ13D 인식 생성 모델은 포트레이트 합성에서 사진적 사실성과 세밀한 편집 가능성 양쪽을 동시에 달성할 수 있는가?
  • RQ2재구성 충실도를 유지하면서도 GAN 역전치를 가속화하고 상호작용 가능하게 만들 수 있는가?
  • RQ33D 공간에서 시야 일관성을 유지하면서 얼굴 특성의 분리된 편집이 가능할 수 있는가?
  • RQ4다중 시야 감독 없이 2D 이미지에서 학습해도 타당한 3D 기하학과 일관된 새로운 시야를 얻을 수 있는가?
  • RQ53D 인식 포트레이트 편집에서 지역 수준의 텍스처 스타일 전이를 효율적이고 충실하게 수행할 수 있는가?

주요 결과

  • IDE-3D는 다양한 편집 작업에서 사진적 사실성, 충실도, 시야 일관성 측면에서 최신 기술 수준의 성능을 달성한다.
  • 하이브리드 GAN 역전치 방법은 순수 최적화 기반 접근에 비해 최적화 시간을 크게 단축시키면서도 고정밀 재구성을 가능하게 한다.
  • 캐논리컬 에디터는 잠재 코드의 재역전치 없이도 고충실도와 높은 효율성을 유지하면서 실시간 편집을 가능하게 한다.
  • 의미 레이블 기반의 스타일 트리플레인을 쿼리하여 지역 수준의 텍스처 편집을 성공적으로 달성하였으며, 대상 영역 외부 영역의 스타일도 유지한다.
  • 이 모델은 이미지 품질과 시야 일관성 측면에서 SofGAN과 FENeRF를 모두 능가하며, 특히 새로운 시야에서 정체성과 텍스처 세부 정보를 잘 유지한다.
  • 학습 중에 다중 시야 증강을 적용함으로써 새로운 시야 합성에서 시야 일관성 부족과 자가 가림 잡음이 크게 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.