Skip to main content
QUICK REVIEW

[논문 리뷰] GeoDream: Disentangling 2D and Geometric Priors for High-Fidelity and Consistent 3D Generation

Baorui Ma, Haoge Deng|arXiv (Cornell University)|2023. 11. 29.
Computer Graphics and Visualization Techniques인용 수 6
한 줄 요약

GeoDream는 텍스트 프롬프트에서 고해상도이고 3D 일관성 있는 질감이 부여된 메시를 생성하기 위해 명시적인 3D 기하학적 사전 지식과 사전 학습된 2D 확산 사전 지식을 결합한 분리된 프레임워크를 소개한다. 다중 시야 2D 예측에서 비용 볼륨을 구성하여 강력한 3D 사전 지식을 만들고, 분리 최적화를 통해 반복적으로 개선함으로써 GeoDream은 장자 문제와 잡음 요소를 크게 감소시키면서도 고해상도(1024×1024)의 현실성과 의미 일관성을 유지한다.

ABSTRACT

Text-to-3D generation by distilling pretrained large-scale text-to-image diffusion models has shown great promise but still suffers from inconsistent 3D geometric structures (Janus problems) and severe artifacts. The aforementioned problems mainly stem from 2D diffusion models lacking 3D awareness during the lifting. In this work, we present GeoDream, a novel method that incorporates explicit generalized 3D priors with 2D diffusion priors to enhance the capability of obtaining unambiguous 3D consistent geometric structures without sacrificing diversity or fidelity. Specifically, we first utilize a multi-view diffusion model to generate posed images and then construct cost volume from the predicted image, which serves as native 3D geometric priors, ensuring spatial consistency in 3D space. Subsequently, we further propose to harness 3D geometric priors to unlock the great potential of 3D awareness in 2D diffusion priors via a disentangled design. Notably, disentangling 2D and 3D priors allows us to refine 3D geometric priors further. We justify that the refined 3D geometric priors aid in the 3D-aware capability of 2D diffusion priors, which in turn provides superior guidance for the refinement of 3D geometric priors. Our numerical and visual comparisons demonstrate that GeoDream generates more 3D consistent textured meshes with high-resolution realistic renderings (i.e., 1024 $ imes$ 1024) and adheres more closely to semantic coherence.

연구 동기 및 목표

  • 2D 확산 모델을 사용한 텍스트 기반 3D 생성에서 지속적인 3D 기하학적 구조의 불일치(장자 문제)와 심각한 잡음 요소를 해결하기 위해.
  • 고해상도, 다양성, 현실성 있는 3D 출력을 손상시키지 않은 채 3D 일관성을 향상시키기 위해.
  • 기본 모델을 침습적으로 미세조정하지 않고도 2D 확산 모델이 3D 인식 능력을 갖도록 명시적인 3D 사전 지식을 통해 가능하게 하기 위해.
  • 비완전한 다중 시야 2D 예측에서 비용 볼륨 집계를 통해 강력한 3D 사전 지식을 구성하기 위해.
  • 2D 및 3D 사전 지식 간 双방향 개선 루프를 구축하여 기하학적 및 의미적 정확성을 향상시키기 위해.

제안 방법

  • 다중 시야 2D 이미지 특징을 분산 및 투영 연산을 사용해 비용 볼륨으로 집계함으로써 3D 기하학적 사전 지식을 생성한다.
  • 비용 볼륨을 처리하기 위해 3D 특징 네트워크를 사용하여 개별 시야의 불일치와 무관하게 공간적으로 일관된 3D 사전 지식을 생성한다.
  • LoRA 적응된 2D 확산 모델을 훈련시켜 기존 기반 모델을 미세조정하지 않고도 3D 사전 지식을 활용함으로써 2D 및 3D 사전 지식을 분리한다.
  • 2D 확산 사전 지식이 반복 최적화를 통해 3D 사전 지식의 개선을 이끄는 피드백 루프를 통해 3D 기하학적 사전 지식을 개선한다.
  • 최적화된 3D 표현에서 고해상도 질감 메시를 추출하기 위해 DMTet 기반 메시 추출 파이프라인을 사용한다.
  • 다중 카메라 시야에서 사전 학습된 2D 확산 모델과 일치시키기 위해 가중치가 부여된 노이즈 제거 손실을 사용한다.
Figure 1 : GeoDream alleviates the Janus problems by incorporating explicit 3D priors with 2D diffusion priors. GeoDream generates consistent multi-view rendered images and rich details textured meshes. We remove rendering background to achieve a clearer visualization.
Figure 1 : GeoDream alleviates the Janus problems by incorporating explicit 3D priors with 2D diffusion priors. GeoDream generates consistent multi-view rendered images and rich details textured meshes. We remove rendering background to achieve a clearer visualization.

실험 결과

연구 질문

  • RQ1다중 시야 2D 예측에서 유도된 명시적인 3D 기하학적 사전 지식이 텍스트 기반 3D 생성에서 3D 일관성을 향상시킬 수 있는가?
  • RQ22D 및 3D 사전 지식을 분리함으로써 기존 모델의 미세조정 없이도 2D 확산 모델이 더 나은 3D 인식 행동을 보일 수 있는가?
  • RQ3비용 볼륨 집계가 다중 시야 2D 예측의 불일치를 효과적으로 걸러내어 강력한 3D 사전 지식을 생성하는 데 효과적인가?
  • RQ42D 및 3D 사전 지식 간 양방향 개선 루프가 3D 생성의 기하학적 및 의미적 정확성을 어떻게 향상시키는가?
  • RQ5GeoDream이 Zero123 및 MVDream과 같은 다양한 다중 시야 확산 모델에 대해 얼마나 잘 일반화되는가?

주요 결과

  • GeoDream는 1024×1024 해상도와 고해상도 질감을 갖춘 3D 자산을 생성하면서 장자 문제와 잡음 요소를 크게 감소시켰다.
  • 비대칭적이고 상상력이 풍부한 객체를 포함한 다양한 복잡한 프롬프트에서도 우수한 3D 일관성과 의미 일관성을 달성했다.
  • 제거 분석 결과, GeoDream가 Zero123 및 Zero123++와 같은 다양한 다중 시야 확산 모델에서 유도된 소스 시야에 대해 잘 일반화됨을 확인했다.
  • 2D 및 3D 사전 지식 간 분리된 개선 루프는 종래의 엔드 투 엔드 또는 공동 최적화 기반 방법에 비해 더 나은 기하학적 구조와 질감 세부 정보를 제공한다.
  • 비용 볼륨 기반 3D 사전 지식 구성 방식은 다중 시야 예측의 불일치를 효과적으로 완화하며, 직접적인 다중 시야 일관성에 의존하는 방법보다 우수한 성능을 보였다.
  • 정량적 3D 메트릭과 정성적 비교 결과, GeoDream는 이전 방법들보다 더 현실적이고 기하학적으로 일관된 메시를 생성함을 입증했다.
Figure 2 : The overview of GeoDream. (a) 3D priors training. (b) Incorporating 3D priors with 2D diffusion priors.
Figure 2 : The overview of GeoDream. (a) 3D priors training. (b) Incorporating 3D priors with 2D diffusion priors.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.