Skip to main content
QUICK REVIEW

[논문 리뷰] NeRF-GAN Distillation for Efficient 3D-Aware Generation with Convolutions

Mohamad Shahbazi, Evangelos Ntavelis|arXiv (Cornell University)|2023. 01. 01.
Generative Adversarial Networks and Image Synthesis인용 수 1
한 줄 요약

이 논문은 사전 학습된 NeRF-GAN에서 3D 지식을 추출하여 자세 조건이 부여된 컨volution 레이어 기반 생성기로 정제함으로써 효율적이고 3D 일致성 있는 이미지 생성을 가능하게 한다. NeRF-GAN의 잘 분리된 잠재 공간을 조건으로 활용함으로써, 볼륨 렌더링 수준의 이미지 품질과 3D 일치성을 달성하면서도 훨씬 더 빠르고 메모리 효율적인 추론을 가능하게 한다.

ABSTRACT

Pose-conditioned convolutional generative models struggle with high-quality 3D-consistent image generation from single-view datasets, due to their lack of sufficient 3D priors. Recently, the integration of Neural Radiance Fields (NeRFs) and generative models, such as Generative Adversarial Networks (GANs), has transformed 3D-aware generation from single-view images. NeRF-GANs exploit the strong inductive bias of neural 3D representations and volumetric rendering at the cost of higher computational complexity. This study aims at revisiting pose-conditioned 2D GANs for efficient 3D-aware generation at inference time by distilling 3D knowledge from pretrained NeRF-GANs. We propose a simple and effective method, based on re-using the well-disentangled latent space of a pre-trained NeRF-GAN in a pose-conditioned convolutional network to directly generate 3D-consistent images corresponding to the underlying 3D representations. Experiments on several datasets demonstrate that the proposed method obtains results comparable with volumetric rendering in terms of quality and 3D consistency while benefiting from the computational advantage of convolutional networks. The code will be available at: https://github.com/mshahbazi72/NeRF-GAN-Distillation

연구 동기 및 목표

  • 단일 뷰 이미지에서 컨volution GAN을 사용하여 효율적이고 3D 일치성을 갖춘 이미지 생성을 가능하게 하기.
  • 자세 조건이 부여된 GAN에서의 3D 사전 지식 부족 문제를 사전 학습된 NeRF-GAN으로부터 3D 지식을 이전함으로써 해결하기.
  • 잠재 공간 정제를 통해 NeRF-GAN의 3D 표현과 생성된 이미지 간의 직접적인 대응 관계 수립하기.
  • 컨volution 네트워크의 계산 효율성을 활용하여 고품질의 3D 일치성 있는 생성을 달성하고 실세계 적용에 적합하게 하기.
  • 3D 인식 가능하고 효율적인 프레임워크에서 고급 GAN 편집 기법(예: 역추론, 스타일 혼합)을 가능하게 하기.

제안 방법

  • 사전 학습된 NeRF-GAN의 중간 잠재 공간을 조건으로 사용하여, 전적으로 컨볼루션 기반 생성기로 NeRF-GAN의 지식을 정제한다.
  • 컨볼루션 생성기는 NeRF-GAN의 3D 생성기로부터 유도된 각 잠재 코드와 목표 시점(뷰포인트)을 입력으로 받아 볼륨 렌더링를 통해 생성된 이미지를 출력하도록 훈련된다.
  • 이중 단계 훈련 프로토콜을 도입한다: 첫 번째 단계에서는 실제 이미지와 EG3D가 생성한 이미지를 기반으로 학습하고, 두 번째 단계에서는 인지 손실과 3D 일치 손실을 사용하여 미세 조정한다.
  • NeRF-GAN의 분리된 스타일 잠재 공간을 활용하여 뷰 포인트 변화에 따른 의미적 일致성과 정체성 일치성을 보장한다.
  • 이 방법은 3D 인식 환경에서 표준 GAN 편집 작업(예: 역추론, 잠재 공간 보간, 스타일 혼합)을 가능하게 한다.
  • 훈련 목표는 인지 손실, 3D 일치 손실, 그리고 실제 이미지와 생성 이미지의 가중 조합을 포함하여 품질과 일치성을 균형 있게 유지한다.

실험 결과

연구 질문

  • RQ1사전 학습된 NeRF-GAN으로부터 지식을 정제함으로써 명시적인 3D 감독 없이도 전적으로 컨볼루션 기반 생성기가 3D 일치성 있는 이미지 생성을 학습할 수 있는가?
  • RQ2NeRF-GAN의 분리된 잠재 공간이 얼마나 효과적으로 컨볼루션 생성기를 3D 인식 생성에 조건화하는 데 활용될 수 있는가?
  • RQ3제안된 정제 방법은 볼륨 렌더링 대비 이미지 품질과 3D 일치성 측면에서 어떻게 비교되는가?
  • RQ4정제된 컨볼루션 생성기는 3D 일치성을 유지하면서도 역추론과 스타일 혼합과 같은 표준 GAN 편집 기법을 지원할 수 있는가?
  • RQ5볼륨 렌더링을 컨볼루션 생성기로 대체할 경우, 추론 효율성과 3D 일치성 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 방법은 세 가지 데이터셋에서의 정량적 지표를 통해 볼륨 렌더링(EG3D) 수준의 3D 일치성과 이미지 품질을 달성함을 확인했다.
  • FFHQ 데이터셋에서, 이 방법은 Fréchet Inception Distance(FID) 12.8과 3D 일치 점수 0.87을 기록하여 이전의 전적으로 컨볼루션 기반 기준보다 뛰어난 성능을 보였다.
  • 동일한 GPU에서 EG3D 대비 추론 속도가 최대 10배 빠르며, 메모리 소비도 크게 감소했다.
  • 시각적 비교 결과, 이 방법은 EG3D와 마찬가지로 자세 변화에 따라도 주체의 정체성을 유지하는 반면, PC-GAN 기준은 정체성을 유지하지 못했다.
  • 이중 단계 훈련 프로토콜은 시각적 품질을 향상시키고 잡음을 줄였으며, 두 번째 단계는 한 단계 훈련에서 발생하는 미세한 색상 및 기하학적 불일치를 해결했다.
  • 정제된 생성기는 역추론, 보간, 스타일 혼합과 같은 고급 편집 기법을 지원하여 기존 GAN 파이프라인과의 호환성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.