Skip to main content
QUICK REVIEW

[논문 리뷰] Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and Reconstruction

Hansheng Chen, Jiatao Gu|arXiv (Cornell University)|2023. 04. 13.
Advanced Vision and Imaging인용 수 5
한 줄 요약

SSDNeRF는 다중 시야 이미지에서 단일 단계의 확산 모델을 제안하며, NeRF 오토디코더와 3D 잠재 확산 사전을 동시에 학습함으로써 통합된 3D 생성 및 재구성에 대한 엔드 투 엔드 학습을 가능하게 한다. 이는 무조건적 3D 생성 및 단일/희박 시야 재구성에서 최신 기술 수준의 성능을 달성하며, 3장의 시야조차도 가능하다.

ABSTRACT

3D-aware image synthesis encompasses a variety of tasks, such as scene generation and novel view synthesis from images. Despite numerous task-specific methods, developing a comprehensive model remains challenging. In this paper, we present SSDNeRF, a unified approach that employs an expressive diffusion model to learn a generalizable prior of neural radiance fields (NeRF) from multi-view images of diverse objects. Previous studies have used two-stage approaches that rely on pretrained NeRFs as real data to train diffusion models. In contrast, we propose a new single-stage training paradigm with an end-to-end objective that jointly optimizes a NeRF auto-decoder and a latent diffusion model, enabling simultaneous 3D reconstruction and prior learning, even from sparsely available views. At test time, we can directly sample the diffusion prior for unconditional generation, or combine it with arbitrary observations of unseen objects for NeRF reconstruction. SSDNeRF demonstrates robust results comparable to or better than leading task-specific methods in unconditional generation and single/sparse-view 3D reconstruction.

연구 동기 및 목표

  • 무조건적 생성 및 이미지 기반 재구성과 같은 다양한 3D 작업을 위한 통합 프레임워크 개발에 도전한다.
  • 희박한 시야에서의 불완전한 NeRF 재구성으로 인해 발생하는 노이즈가 많은 잠재 다각형의 문제를 해결하기 위해 이중 단계 학습의 한계를 극복한다.
  • NeRF와 확산 모델의 엔드 투 엔드 학습을 통해 생성 및 렌더링의 편향을 유기적으로 융합하여 성능을 향상시킨다.
  • 학습된 사전을 활용하여 임의의 수의 입력 시야에서의 영향력 있는 3D 재구성 가능성을 제공하는 테스트 시점 가이던스 미세조정 기법을 개발한다.
  • 이전 방법이 아티팩트 전파로 인해 실패하는 경우조차도, 3장의 입력 시야를 포함한 희박한 시야 데이터에서 강력한 성능을 보여준다.

제안 방법

  • NeRF 오토디코더 가중치와 잠재 확산 모델 가중치를 통합된 엔드 투 엔드 목적 함수를 사용해 동시에 최적화하는 단일 단계 학습 프레임워크를 제안한다.
  • 3D 장면 인코딩을 위한 트라이플레이너 특징 표현을 사용하여 효율적이고 표현력 있는 신경 볼륨 렌더링 필드 모델링을 가능하게 한다.
  • 다중 시야 이미지에서 유도된 장면 잠재 코드에 직접 3D 잠재 확산 모델을 학습시켜 사전 학습된 NeRF가 필요 없도록 한다.
  • 재구성에 대해 임의의 입력 시야를 조건으로 삼는 테스트 시점에서의 가이던스 미세조정 샘플링 기법을 도입한다.
  • 학습 중 조기 정지 기법을 적용하여 더 부드러운 잠재 사전을 유지함으로써, 희박한 시야 재구성에서의 일반화 능력을 향상시킨다.
  • DDIM 기반 샘플링과 구면 선형 보간을 사용하여 학습된 사전 내에서 잠재 공간 보간의 부드러움을 평가한다.

실험 결과

연구 질문

  • RQ1이중 단계 학습에서 발생하는 아티팩트를 피할 수 있는 단일 단계 학습 프레임워크를 통해 통합된 3D 생성 및 재구성 프레임워크를 구축할 수 있는가?
  • RQ2사전 학습된 NeRF에 의존하지 않고, 희박한 시야의 다중 장면 데이터로부터 직접 깔끔하고 일반화 가능한 3D 사전을 학습할 수 있는가?
  • RQ3학습된 확산 사전은 임의의 수의 입력 시야에서 테스트 시점에 고품질의 3D 재구성을 얼마나 효과적으로 가능하게 하는가?
  • RQ4NeRF와 확산 구성 요소를 엔드 투 엔드로 공동 최적화하는 것이, 희박한 시야 데이터에서 분리된 이중 단계 학습보다 더 나은 성능을 내는가?
  • RQ5확산 모델의 잠재 공간이 3D 장면 간에 매끄럽고 의미 있는 보간을 지원하는가? 이는 잘 구조화되고 일반화 가능한 사전임을 시사한다.

주요 결과

  • SSDNeRF는 SRN Cars 데이터셋의 3장 시야 서브셋에서 Fréchet Inception Distance (FID) 19.04 ±1.10과 Kernel Inception Distance (KID) 8.28 ±0.60을 기록하여 강력한 무조건적 3D 생성 품질을 입증한다.
  • 단일 시야 재구성에서 SSDNeRF는 LPIPS 점수 0.106을 기록하며, 전체 학습 세트를 사용하는 대부분의 이전 방법보다 뛰어난 성능을 보였다.
  • 희박한 시야에서 고밀도 재구성에서, SSDNeRF는 TV 정규화가 적용된 보편적인 트라이플레이너 NeRF와 CodeNeRF를 크게 능가했으며, 특히 1~4장의 낮은 시야 수에서 두각을 나타냈다.
  • 기존의 TV 정규화가 적용된 자동 인코더는 동일 조건에서 실패했지만, SSDNeRF는 오직 3장의 입력 시야만으로도 일관되고 아티팩트 없는 기하학적 구조를 재구성했다.
  • 학습 중 조기 정지를 통해 더 부드러운 잠재 사전을 유지함으로써, 생성된 3D 장면 간의 일관성 있고 시각적으로 타당한 보간이 가능했다.
  • 가이던스 미세조정 샘플링 기법은 임의의 수의 시야에서 효과적인 재구성을 가능하게 하여, 테스트 시점에서 학습된 확산 사전의 유연성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.