Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Graphics Pipeline for Controllable Image Generation

Xuelin Chen, Daniel Cohen‐Or|arXiv (Cornell University)|2020. 06. 18.
Computer Graphics and Visualization Techniques참고 문헌 36인용 수 4
한 줄 요약

Neural Graphics Pipeline (NGP)는 신경망과 전통적인 이미지 형성 방식을 융합한 하이브리드 생성 모델로, 제어 가능한 이미지 생성을 가능하게 한다. 이는 거친 3D 모델을 생성하고, 신경 렌더링을 통해 시점별 2D 지ap을 렌더링하며, 전통적 렌더링을 이용해 이를 복합화함으로써, 비지도 학습 중에 명시적인 이미지 대응 없이도 조명, 카메라, 형태, 외관에 대한 직접적인 제어와 함께 향상된 FID 점수를 달성한다.

ABSTRACT

We present Neural Graphics Pipeline (NGP), a hybrid generative model that brings together neural and traditional image formation models. NGP generates coarse 3D models that are fed into neural rendering modules to produce view-specific interpretable 2D maps, which are then composited into the final output image using a traditional image formation model. Our approach offers control over image generation by providing direct handles controlling illumination and camera parameters, in addition to control over shape and appearance variations. The key challenge is to learn these controls through unsupervised training that links generated coarse 3D models with unpaired real images via neural and traditional (e.g., Blinn-Phong) rendering functions without establishing an explicit correspondence between them. We evaluate our hybrid modeling framework, compare with neural-only generation methods (namely, DCGAN, LSGAN, WGAN-GP, VON, and SRNs), report improvement in FID scores against real images, and demonstrate that NGP supports direct controls common in traditional forward rendering. Code, data, and trained models will be released on acceptance.

연구 동기 및 목표

  • 형태와 외관을 넘어서 세밀한 제어가 가능한 생성 모델을 개발하는 것.
  • 신경망과 전통적 이미지 형성 모델을 융합하여 제어성과 현실감을 향상시키는 것.
  • 생성된 3D 모델과 실사 이미지 간의 명시적 대응이 필요 없이 비지도 학습 방식으로 모델을 훈련시키는 것.
  • 기존 전통적 렌더링 파이프라인과 유사하게 이미지 생성 중에 조명 및 카메라 파라미터를 직접 조작할 수 있도록 하는 것.
  • 신경망 전용 방법에 비해 FID 점수로 측정된 이미지 생성 품질에서 최신 기준 수준의 성능을 달성하는 것.

제안 방법

  • NGP는 이미지 합성의 초기 잠재 표현으로 거친 3D 모델을 생성한다.
  • 신경 렌더링 모듈은 3D 기하학적 구조와 시점 파라미터에 조건화된 시점별 2D 특징 지ap을 생성한다.
  • 블린-포نغ(Blinn-Phong)와 같은 전통적 이미지 형성 모델이 렌더링된 2D 지압을 최종 이미지로 복합화하는 데 사용된다.
  • 다양분성 신경 및 전통적 렌더링 함수를 통해 생성된 이미지를 실사 이미지와 정렬함으로써, 비지도 학습 방식으로 모델을 훈련시킨다.
  • 조명 및 카메라 파라미터에 대한 제어 신호를 직접 렌더링 파이프라인에 통합하여 종단 간 제어성을 실현한다.
  • 다양분성 렌더링과 적대적 훈련을 활용하여 생성된 3D 모델과 실사 이미지 간의 명시적 대응을 회피한다.

실험 결과

연구 질문

  • RQ1하이브리드 신경-전통 렌더링 파이프라인은 조명 및 카메라 파라미터의 직접 조작이 가능한 제어 가능한 이미지 생성을 가능하게 할 수 있는가?
  • RQ2생성된 3D 모델과 실사 이미지 간의 명시적 대응이 없는 조건에서 훈련된 모델이 순수 신경망 방법에 비해 얼마나 잘 성능을 내는가?
  • RQ3신경망과 전통적 렌더링을 융합함으로써 생성 모델의 이미지 품질과 제어성은 어느 정도 향상되는가?
  • RQ4NGP 프레임워크는 전통적 프론트엔드 렌더링 파이프라인과 동일한 수준의 제어를 지원할 수 있는가 동시에 생성 유연성도 유지하는가?
  • RQ5FID 점수 측면에서 DCGAN, WGAN-GP, SRNs와 같은 순수 신경망 생성 모델에 비해 NGP는 얼마나 더 높은 성능 향상을 달성하는가?

주요 결과

  • NGP는 DCGAN, LSGAN, WGAN-GP, VON, SRNs와 같은 순수 신경망 생성 모델에 비해 향상된 Fréchet Inception Distance (FID) 점수를 달성한다.
  • 모델은 조명 및 카메라 파라미터에 대한 직접적 제어를 지원하여 전통적 렌더링 파이프라인과 유사한 조작을 가능하게 한다.
  • 비지도 학습 기반의 훈련 방식이 거친 3D 모델과 실사 이미지를 명시적 2D-3D 대응 없이 성공적으로 연결했다.
  • 하이브리드 아키텍처는 더 높은 이미지 품질과 형태, 외관, 조명, 카메라 제어의 분리도 향상시켰다.
  • 프레임워크는 신경망과 전통적 렌더링을 융합함으로써 제어성과 생성 정확도를 동시에 향상시킬 수 있음을 입증했다.
  • 논문 수락 시 코드, 데이터, 학습된 모델이 공개되어 재현성과 향후 연구를 지원할 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.