Skip to main content
QUICK REVIEW

[논문 리뷰] Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation

Jichao Zhang, Aliaksandr Siarohin|arXiv (Cornell University)|2022. 08. 26.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 분리된 속성 제어를 갖춘 3D 인식 얼굴 생성을 위한 조건부 생성 신경 렌디언스 필드(GNeRF) 모델을 제안한다. 정규화된 플로우 모듈과 잠재 최적화를 포함한 '학습을 초기화하고 튜닝을 위해 최적화하는'(TRIOT) 방법을 도입함으로써, 정체성과 기하학적 구조를 유지하면서도 고해상도이고 시야 일致성 있는 편집을 달성하며, 이는 이전 방법들보다 속성 편집 정밀도와 3D 일관성에서 뛰어난 성능을 보인다.

ABSTRACT

Generative Neural Radiance Fields (GNeRF)-based 3D-aware GANs have showcased remarkable prowess in crafting high-fidelity images while upholding robust 3D consistency, particularly face generation. However, specific existing models prioritize view consistency over disentanglement, leading to constrained semantic or attribute control during the generation process. While many methods have explored incorporating semantic masks or leveraging 3D Morphable Models (3DMM) priors to imbue models with semantic control, these methods often demand training from scratch, entailing significant computational overhead. In this paper, we propose a novel approach: a conditional GNeRF model that integrates specific attribute labels as input, thus amplifying the controllability and disentanglement capabilities of 3D-aware generative models. Our approach builds upon a pre-trained 3D-aware face model, and we introduce a Training as Init and Optimizing for Tuning (TRIOT) method to train a conditional normalized flow module to enable the facial attribute editing, then optimize the latent vector to improve attribute-editing precision further. Our extensive experiments substantiate the efficacy of our model, showcasing its ability to generate high-quality edits with enhanced view consistency while safeguarding non-target regions. The code for our model is publicly available at https://github.com/zhangqianhui/TT-GNeRF.

연구 동기 및 목표

  • 3D 인식 GAN을 통한 얼굴 생성에서 의미적 분리와 정밀한 속성 제어의 부족을 해결하기 위해.
  • 정체성과 3D 기하학적 구조를 여러 시점에서 유지하면서도 세밀한 속성 조건부 편집을 가능하게 하기 위해.
  • 백본 GNeRF 모델을 재학습하지 않고도 편집 정확도를 향상시키는 효율적인 튜닝 프레임워크를 개발하기 위해.
  • 다중 속성 편집 및 참조 기반 기하학적 전이와 같은 복잡한 편집 작업을 지원하기 위해.

제안 방법

  • 재학습을 방지하기 위해 사전 학습된 3D 인식 GNeRF 백본을 기반으로 한다.
  • 잠재 공간의 분리된 조작을 가능하게 하기 위해 '학습을 초기화' 전략으로 훈련된 조건부 정규화된 플로우 모듈을 도입한다.
  • 이중 단계의 TRIOT 프레임워크를 제안한다: 첫 번째 단계는 플로우 모듈을 훈련하는 것, 두 번째 단계는 속성 편집 정밀도 향상을 위해 잠재 코드를 최적화하는 것.
  • 최적화 단계에서는 비표적 영역을 보존하기 위해 질감 일관성과 기하학적 일관성을 결합한 다중 구성 요소 손실을 사용한다.
  • 잠재 코드를 참조 메쉬와 일치하도록 최적화하여 참조 기반 기하학적 전이를 지원한다.
  • 실사 이미지 편집을 위해 GAN 역전환을 가능하게 하며, 3D 인식 얼굴 모델을 재구성하고 속성 편집을 적용한다.

실험 결과

연구 질문

  • RQ1속성 레이블이 3D 인식 GAN을 조건부로 하여 분리된 얼굴 속성 편집에 효과적으로 사용될 수 있는가?
  • RQ2백본 모델을 재학습하지 않고도 3D 인식 GAN에서 잠재 공간의 분리가 달성될 수 있는가?
  • RQ3속성 편집 정밀도와 정체성 및 기하학적 구조 보존 사이의 균형을 이루는 최적화 전략은 무엇인가?
  • RQ4제안된 방법은 다중 속성 편집 및 참조 기반 기하학적 전이와 같은 복잡한 편집 작업을 지원할 수 있는가?
  • RQ5시야 일관성과 편집 충실도 측면에서 이전 방법들과 비교해 볼 때 방법의 성능은 어떠한가?

주요 결과

  • 제안된 TRIOT 방법은 기준선 방법 대비 CA(속성 정확도) 및 LP(LPIPS) 점수에서 정량적 향상을 보이며 뛰어난 속성 편집 정밀도를 달성한다.
  • 최적화 단계는 특히 머리카락과 배경과 같은 비표적 영역에서 정체성과 기하학적 구조 보존을 크게 향상시킨다. 이는 정성적 비교를 통해 확인된다.
  • 100~150회의 최적화 단계를 거치면 편집 정밀도와 정체성 보존 사이의 최적의 균형을 달성하며, 감소하는 LP 및 CA 점수로 확인된다.
  • 표현, 성별, 머리카락 색상과 같은 다중 속성의 연속 편집 후에도 모델은 여러 시점에서 강력한 3D 시야 일관성을 유지한다.
  • 참조 메시와 일치하도록 잠재 코드를 최적화함으로써 참조 기반 기하학적 전이가 성공적으로 구현되었으며, 정체성과 질감을 포함한 외관을 유지한다.
  • 실사 이미지에 대한 고품질 GAN 역전환을 가능하게 하여 정확한 재구성과 정밀한 속성 편집을 제공하며, 비표적 영역에서 최소한의 왜곡을 유발한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.