Skip to main content
QUICK REVIEW

[논문 리뷰] NeuralField-LDM: Scene Generation with Hierarchical Latent Diffusion Models

Seung Wook Kim, Bradley Brown|arXiv (Cornell University)|2023. 04. 19.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

NeuralField-LDM는 포즈가 맞춰진 이미지와 깊이 데이터로부터 복잡하고 고품질의 3D 실세계 환경을 생성하기 위해 계층적인 잠복 확산 모델을 도입한다. 이 모델은 자동에코더를 통해 환경를 신경장으로 인코딩하고, 다중 척도 잠복상태(3D 거친, 2D 정밀, 1D 전역)로 압축한 후, 계층적인 확산 모델을 사용해 새로운 환경를 생성하며, 네 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하면서 조건부 생성, 스타일 전이 및 편집 기능을 지원한다.

ABSTRACT

Automatically generating high-quality real world 3D scenes is of enormous interest for applications such as virtual reality and robotics simulation. Towards this goal, we introduce NeuralField-LDM, a generative model capable of synthesizing complex 3D environments. We leverage Latent Diffusion Models that have been successfully utilized for efficient high-quality 2D content creation. We first train a scene auto-encoder to express a set of image and pose pairs as a neural field, represented as density and feature voxel grids that can be projected to produce novel views of the scene. To further compress this representation, we train a latent-autoencoder that maps the voxel grids to a set of latent representations. A hierarchical diffusion model is then fit to the latents to complete the scene generation pipeline. We achieve a substantial improvement over existing state-of-the-art scene generation models. Additionally, we show how NeuralField-LDM can be used for a variety of 3D content creation applications, including conditional scene generation, scene inpainting and scene style manipulation.

연구 동기 및 목표

  • 명시적인 3D 지도 자료가 필요 없이도 확장성 있고 고품질의 3D 환경 생성에 도전하는 것.
  • 이전의 3D 확산 모델에서 단일 벡터 조건부 처리의 한계를 극복하여 복잡한 환경 분포의 모델링을 가능하게 하는 것.
  • 조건부 생성, 스타일 전이, 환경 편집과 같은 다양한 3D 콘텐츠 생성 응용을 가능하게 하는 것.
  • 잠복공간 확산과 사전 훈련된 이미지 확산 모델로부터의 스코어 정련을 활용해 샘플의 품질과 다양성을 향상시키는 것.
  • 포즈가 맞춰진 이미지와 깊이 자료만을 사용하는 확장 가능한 파이프라인을 개발하여 데이터 수집을 더욱 실용적으로 만드는 것.

제안 방법

  • 포즈가 맞춰진 이미지와 깊이 쌍으로부터 3D 환경를 밀도 및 특징 박막 그리드로 표현하기 위해 환경 자동에코더를 훈련한다.
  • 박막 그리드를 계층적 잠복공간(3D 거친, 2D 정밀, 1D 전역 잠복상태)으로 압축하기 위해 잠복자기에코더를 적용한다.
  • 삼중 잠복상태 표현을 기반으로 계층적 확산 모델을 훈련하여 새로운 3D 환경를 생성한다.
  • 사전 훈련된 CLIP-에코더를 사용한 스코어 정련 샘플링(SDS)을 적용해 생성된 신경장의 시각적 품질을 향상시킨다.
  • 새로운 조건부 생성을 가능하게 하기 위해 새롭게 조건부로 설정된 조감도 세그먼테이션 맵이나 텍스트 프롬프트를 사용한다.
  • CLIP 방향 손실을 활용한 잠복공간 조작 및 미세조정을 통해 환경 편집 및 스타일 전이를 지원한다.

실험 결과

연구 질문

  • RQ1명시적인 3D 감독 없이도 2D 이미지와 깊이 데이터로부터 계층적 잠복 확산 모델이 다양한 고품질 3D 환경를 효과적으로 생성할 수 있는가?
  • RQ2단일 벡터 조건부 처리와 비교해 계층적 잠복공간 분해가 3D 환경 생성의 모델링 능력과 품질에 어떻게 기여하는가?
  • RQ3사전 훈련된 이미지 확산 모델로부터의 스코어 정련이 생성된 3D 환경의 시각적 정밀도를 크게 향상시킬 수 있는가?
  • RQ4NeuralField-LDM는 세분화된 맵이나 텍스트 프롬프트를 사용해 조건부 환경 생성을 어느 정도 지원할 수 있는가?
  • RQ5모델은 3D 공간에서 고품질의 콘텐츠 유지 스타일 전이 및 환경 편집을 어떻게 가능하게 하는가?

주요 결과

  • NeuralField-LDM는 네 가지 과도한 3D 환경 생성 벤치마크에서 최신 기술 수준의 성능을 달성하여 품질과 다양성 측면에서 이전 방법들을 능가한다.
  • 계층적 잠복공간 설계는 전역, 국소, 세밀한 특징를 분리함으로써 더 나은 복잡한 환경 구조 모델링을 가능하게 한다.
  • 사전 훈련된 CLIP 모델을 활용한 스코어 정련은 특히 구조적이고 질감적인 세부 사항에서 생성된 환경의 시각적 품질을 크게 향상시킨다.
  • 조감도 세그먼테이션 맵을 사용한 조건부 생성은 정확하고 의미 기반의 환경 합성과 정밀한 레이아웃 제어를 가능하게 한다.
  • CLIP 방향 손실을 통한 텍스트 기반 스타일 전이는 다양한 환경에서 빠르고 일반화 가능한 스타일 적응을 가능하게 하지만, SDS 기반 최적화가 더 높은 품질의 결과를 낳는다.
  • 잠복공간에서의 재샘플링을 통한 환경 편집은 지역적이고 콘텐츠 유지가 가능한 수정을 가능하게 하며, 동시에 전반적인 일관성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.