Skip to main content
QUICK REVIEW

[논문 리뷰] 3D-LDM: Neural Implicit 3D Shape Generation with Latent Diffusion Models

Gimin Nam, Mariem Khlifi|arXiv (Cornell University)|2022. 12. 01.
3D Shape Modeling and Analysis인용 수 16
한 줄 요약

3D-LDM는 사전 학습된 오토디코더의 잠재공간에서 작동하는 잠재 확산 모델을 도입하여 신경 은닉 표현(부호 거리 함수)을 사용해 고품질의 3D 형상을 생성한다. 이는 표면의 연속성과 다양성을 보장하며, CLIP 조건부 조절을 통해 텍스트-에서-3D 및 이미지-에서-3D 생성을 지원하고, 노이즈 주입을 통한 유도된 형상 탐색도 가능하게 한다. 이 모델은 무조건적 3D 형상 생성에서 최신 기준 성능을 달성한다.

ABSTRACT

Diffusion models have shown great promise for image generation, beating GANs in terms of generation diversity, with comparable image quality. However, their application to 3D shapes has been limited to point or voxel representations that can in practice not accurately represent a 3D surface. We propose a diffusion model for neural implicit representations of 3D shapes that operates in the latent space of an auto-decoder. This allows us to generate diverse and high quality 3D surfaces. We additionally show that we can condition our model on images or text to enable image-to-3D generation and text-to-3D generation using CLIP embeddings. Furthermore, adding noise to the latent codes of existing shapes allows us to explore shape variations.

연구 동기 및 목표

  • 기존 3D 확산 모델이 볼륨 또는 포인트 클라우드 표현에 의존함에 따라 표면의 연속성이 떨어지고 그래픽 응용 분야에서 비효율적인 점을 해결하기 위해.
  • 지속적인 표면을 표현하는 신경 은닉 함수(SDF)를 사용해 고품질이고 다양한 3D 형상 생성을 가능하게 하기 위해.
  • 오토디코더의 잠재공간에서 작동하는 확산 모델을 통해 훈련 안정성과 생성 품질을 향상시키기 위해.
  • 텍스트-에서-3D 및 이미지-에서-3D 형상 합성에 대해 CLIP 임베딩을 조건부 신호로 사용할 수 있도록 지원하기 위해.
  • 기존 형상의 잠재 코드에 제어 가능한 노이즈를 주입하여 설계 탐색을 위한 유도된 형상 탐색을 가능하게 하기 위해.

제안 방법

  • 이 방법은 이중 단계 훈련 파이프라인을 사용한다: 먼저 DeepSDF 기반 오토디코더를 사전 훈련하여 3D 형상을 잠재공간으로 인코딩하고, 그 다음 이 잠재공간에서 잠재 확산 모델을 훈련한다.
  • 잠재 확산 모델은 등방성 가우시안 노이즈에서 시작하여 역방향 확산 과정을 통해 잠재 벡터를 노이즈 제거하여 새로운 형상 잠재공간을 생성한다.
  • 텍스트나 이미지의 CLIP 임베딩을 조건부 신호로 사용하여 형상 생성을 유도함으로써, 재학습 없이도 제로샷 텍스트-에서-3D 및 이미지-에서-3D 생성이 가능하다.
  • 유도된 형상 탐색을 위해, 모델은 기준 형상의 잠재 코드에 중간 확산 단계(t < T)에서 노이즈를 주입하여 구조적으로 유사하지만 스타일이 다른 다양한 형상을 생성한다.
  • 최종적으로 생성된 잠재 코드를 디코더를 사용해 복원하여 연속적인 SDF를 생성함으로써 고품질의 표면 추출이 가능하다.
  • 모델은 원시 SDF 공간에서 직접 확산을 수행하는 대신 압축되고 분리된 잠재공간을 활용함으로써 효율성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1신경 은닉 오토디코더의 잠재공간에서 작동하는 잠재 확산 모델이 연속적인 표면을 갖는 다양하고 고품질의 3D 형상을 생성할 수 있는가?
  • RQ2CLIP 임베딩을 조건부 신호로 사용하여 제로샷 텍스트-에서-3D 및 이미지-에서-3D 생성이 가능한가?
  • RQ3기존 형상의 잠재 코드에 제어 가능한 노이즈를 주입하여 설계 탐색을 위한 의미 있는 국소적 형상 변형을 유도할 수 있는가?
  • RQ4잠재 확산 접근 방식이 기존의 GAN 기반 및 직접적인 확산 모델보다 신경 은닉 3D 형상 생성에서 더 우수한 성능을 보이는가?
  • RQ5모델은 훈련 분포를 초월하여 과적합 없이 일반화가 가능한가? 형상 다양성과 신규성으로부터 이를 입증할 수 있는가?

주요 결과

  • 3D-LDM는 ShapeNet 의자 데이터셋에서 무조건적 3D 형상 생성에서 최신 기준 성능을 달성하였으며, 샘플 품질과 다양성 측면에서 이전의 GAN 기반 및 확산 기반 방법을 모두 능가한다.
  • 모델은 텍스트 프롬프트에 기반해 다양한 3D 형상을 성공적으로 생성하였으며, '바퀴가 달린 의자' 또는 '침대 모양의 의자'와 같은 기술적 특성을 반영한 형상 생성이 가능했다.
  • CLIP 조건부 조절을 통한 이미지-에서-3D 생성은 입력 이미지의 렌더링과 시각적으로 유사한 형상을 생성하였으며, 심지어 새로운 시점에서도 강력한 제로샷 정렬 성능을 보였다.
  • 중간 확산 단계에서 노이즈 주입을 통한 유도된 형상 탐색은 입력 형상의 거시적 구조를 유지하면서도 국소적 디테일을 다양하게 생성함으로써 설계 탐색을 가능하게 하였다.
  • 모델은 훈련 세트 내의 가장 가까운 이웃과의 비교에서 과적합의 흔적이 없음을 보이며, 예상치 못한 형상으로의 일반화 능력이 뛰어나다는 점을 입증하였다.
  • 고품질 출력에도 불구하고 단일 형상 합성 시간이 기존 베이스라인과 유사하여 계산 효율성이 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.