Skip to main content
QUICK REVIEW

[논문 리뷰] 3DDesigner: Towards Photorealistic 3D Object Generation and Editing with Text-guided Diffusion Models

Gang Li, Heliang Zheng|arXiv (Cornell University)|2022. 11. 25.
Generative Adversarial Networks and Image Synthesis인용 수 12
한 줄 요약

3DDesigner는 텍스트 기반의 확산 모델을 통해 사진처럼 생생한 3D 객체 생성 및 편집을 가능하게 하며, NeRF 기반 조건 모듈과 이중 스트림 비동기 확산 프로세스를 활용하여 다양한 시점 간의 3D 일致성을 보장합니다. 이는 360° 일관된 생성, 단일 시점 기반 3D 국소 편집(노이즈 혼합 및 역행렬 기반), 그리고 한 번의 이미지로 새로운 시점 생성을 가능하게 하여 기존 방법들에 비해 3D 일관성, 이미지 품질, 제어 가능성에서 뛰어난 성능을 발휘합니다.

ABSTRACT

Text-guided diffusion models have shown superior performance in image/video generation and editing. While few explorations have been performed in 3D scenarios. In this paper, we discuss three fundamental and interesting problems on this topic. First, we equip text-guided diffusion models to achieve 3D-consistent generation. Specifically, we integrate a NeRF-like neural field to generate low-resolution coarse results for a given camera view. Such results can provide 3D priors as condition information for the following diffusion process. During denoising diffusion, we further enhance the 3D consistency by modeling cross-view correspondences with a novel two-stream (corresponding to two different views) asynchronous diffusion process. Second, we study 3D local editing and propose a two-step solution that can generate 360-degree manipulated results by editing an object from a single view. Step 1, we propose to perform 2D local editing by blending the predicted noises. Step 2, we conduct a noise-to-text inversion process that maps 2D blended noises into the view-independent text embedding space. Once the corresponding text embedding is obtained, 360-degree images can be generated. Last but not least, we extend our model to perform one-shot novel view synthesis by fine-tuning on a single image, firstly showing the potential of leveraging text guidance for novel view synthesis. Extensive experiments and various applications show the prowess of our 3DDesigner. The project page is available at https://3ddesigner-diffusion.github.io/.

연구 동기 및 목표

  • 3D 생성 분야에서 텍스트 기반 확산 모델의 부족, 특히 3D 일관성 있는 결과를 달성하기 위한 도전 과제를 해결하기 위해.
  • 단일 시점에서의 제어 가능한 3D 국소 편집을 가능하게 하여 일관된 360° 편집 결과를 생성하기 위해.
  • 단일 이미지와 텍스트 가이던스를 기반으로 미세조정하여 한 번의 이미지로 새로운 시점 생성 기능을 확장하기 위해.
  • 3D 일관성을 향상시키기 위해 NeRF 기반 사전 지식과 시점 간 대응 모델링을 통합하기 위해.
  • 2D 편집에서 3D 인식 가능한 편집을 가능하게 하는 노이즈에서 텍스트로의 역행렬 파이프라인을 개발하기 위해.

제안 방법

  • 텍스트와 카메라 시점에서부터 저해상도의 거친 3D 인식 결과를 생성하기 위해 조건 모듈로 NeRF 유사 신경 장을 통합합니다.
  • 서로 다른 시점에서 온 두 개의 시점을 함께 노이즈 제거하는 이중 스트림 비동기 확산 모듈을 활용하여 시점 간 대응 관계를 모델링함으로써 3D 일관성을 향상시킵니다.
  • DDIM 샘플링 중에 노이즈 혼합 전략을 사용하여, 목표 영역의 노이즈를 새로운 텍스트 프롬프트 하에 예측된 노이즈로 교체함으로써 2D 국소 편집을 수행합니다.
  • 2D로 혼합된 노이즈를 시점에 영향을 받지 않는 텍스트 임베딩 공간으로 매핑하는 노이즈에서 텍스트로의 역행렬 과정을 제안하여 단일 편집된 시점에서 360° 생성을 가능하게 합니다.
  • 이미지의 노이즈 버전을 텍스트 가이던스와 함께 노이즈 제거함으로써 단일 이미지에서 모델을 미세조정하여 한 번의 이미지로 새로운 시점 생성을 가능하게 합니다.
  • 텍스트 인코더와 NeRF 기반 3D 감시를 조합하여 확산 모델을 훈련함으로써 텍스트, 이미지, 3D 기하학적 구조 간의 일치를 확보합니다.

실험 결과

연구 질문

  • RQ1텍스트와 카메라 시점에서부터 3D 일관성 있고 사진처럼 생생한 3D 객체를 생성하기 위해 텍스트 기반 확산 모델을 어떻게 적응시킬 수 있는가?
  • RQ2단일 시점 편집을 통해 3D 국소 편집을 달성할 수 있으며, 이때 360° 일관성이 유지되는가?
  • RQ3확산 과정 중 3D 일관성을 유지하기 위해 시점 간 특징 상호작용과 비동기 노이즈 제거의 역할은 무엇인가?
  • RQ4단일 이미지와 텍스트 가이던스만을 사용하여 모델을 한 번의 이미지로 새로운 시점 생성 기능으로 확장할 수 있는가?
  • RQ5NeRF 기반 조건 설정과 노이즈 수준 인식 가이던스는 3D 일관성과 이미지 품질 향상에 어떻게 기여하는가?

주요 결과

  • 3DDesigner는 재현된 기준 모델인 CLIP-NeRF 및 확장된 3DiM에 비해 3D 일관성, 이미지 품질, 제어 가능성 면에서 뛰어난 성능을 보입니다.
  • 절단 실험 결과, 이중 스트림 비동기 확산 모듈이 3D 일관성을 크게 향상시키며, 시점 간 대응 관계 또는 비동기 타임스텝이 제거될 경우 성능 저하가 발생하는 것으로 확인되었습니다.
  • 노이즈 혼합 및 노이즈에서 텍스트로의 역행렬 파이프라인은 단일 시점 편집에서 고해상도의 360° 편집 이미지를 성공적으로 생성하여 기존의 이미지에서 텍스트로의 역행렬에서 흔히 발생하는 아티팩트를 피하고 있습니다.
  • 정량적 평가 결과, 3DDesigner는 한 번의 이미지로 새로운 시점 생성에서 33.14 PSNR와 0.94 SSIM을 기록하여 3DiM(32.53 PSNR, 0.93 SSIM)을 초월했습니다.
  • 시각화 결과는 3DDesigner가 복잡한 편집 및 새로운 시점 생성 시나리오에서 기존 방법들보다 더 현실적이고 일관성 있는 360° 시점을 생성하는 것으로 나타났습니다.
  • 모델은 차량 및 복잡한 형태를 포함한 다양한 3D 객체로 일반화가 잘 되었으며, 생성, 편집, 합성 작업 전반에 걸쳐 여러 정성적 결과를 통해 이를 입증했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.