[논문 리뷰] Dream3D: Zero-Shot Text-to-3D Synthesis Using 3D Shape Prior and Text-to-Image Diffusion Models
Dream3D는 명시적인 3D 형상 사전 지식과 최적화된 텍스트-이미지 확산 모델을 활용하여 고해상도이자 형상 정확도가 높은 3D 콘텐츠를 생성하는 새로운 제로샷 텍스트-3D 합성 프레임워크를 소개한다. CLIP 가이던스를 사용하여 최적화하는 동안 초기화된 신경 레이디언스 필드(NeRF)를 3D 형상 사전 지식으로 초기화하고, 이를 통해 기존 방법들보다 뛰어난 시각적 품질과 구조 정확도를 달성한다.
Recent CLIP-guided 3D optimization methods, such as DreamFields and PureCLIPNeRF, have achieved impressive results in zero-shot text-to-3D synthesis. However, due to scratch training and random initialization without prior knowledge, these methods often fail to generate accurate and faithful 3D structures that conform to the input text. In this paper, we make the first attempt to introduce explicit 3D shape priors into the CLIP-guided 3D optimization process. Specifically, we first generate a high-quality 3D shape from the input text in the text-to-shape stage as a 3D shape prior. We then use it as the initialization of a neural radiance field and optimize it with the full prompt. To address the challenging text-to-shape generation task, we present a simple yet effective approach that directly bridges the text and image modalities with a powerful text-to-image diffusion model. To narrow the style domain gap between the images synthesized by the text-to-image diffusion model and shape renderings used to train the image-to-shape generator, we further propose to jointly optimize a learnable text prompt and fine-tune the text-to-image diffusion model for rendering-style image generation. Our method, Dream3D, is capable of generating imaginative 3D content with superior visual quality and shape accuracy compared to state-of-the-art methods.
연구 동기 및 목표
- CLIP 가이던스 최적화 과정에서 무작위 초기화로 인해 왜곡되거나 비현실적인 3D 형상을 생성하는 문제로 인해 발생하는 구조적 정확도 부족 문제를 해결하기 위해.
- 텍스트-이미지 확산 모델 출력과 이미지-3D 형상 생성기 학습 데이터 간의 모odal 갭을 줄이기 위해, 이는 고품질 3D 형상 생성을 방해한다.
- CLIP 임베딩에 의존하는 대신 강력한 텍스트-이미지 확산 모델을 사용하여 텍스트와 이미지 모odal 간의 직접적 연결을 구축함으로써 3D 형상 사전 지식의 품질을 향상시키기 위해.
- CLIP 가이던스 최적화 중 구조적 정합성을 유지하기 위해 3D 사전 지식 유지 손실을 도입함으로써 최적화 안정성을 향상시키기 위해.
- 명시적인 3D 형상 사전 지식과 확산 기반 생성을 조합함으로써 고시각적 품질과 충실한 형상 재구성 모두를 달성할 수 있음을 보여주기 위해.
제안 방법
- 두 단계 파이프라인: 먼저, 최적화된 Stable Diffusion 모델을 사용해 텍스트에서 3D 형상 사전 지식을 생성하고, 이를 바탕으로 이미지-형상 생성기로 텍스처가 있는 3D 형상을 생성한다.
- 생성된 3D 형상을 신경 레이디언스 필드**(NeRF)** 의 초기화로 사용하여 무작위 초기화를 대체함으로써 구조적 인덕티브 바이어스를 제공한다.
- 텍스트-이미지 확산 모델을 학습 가능한 텍스트 프롬프트와 함께 공동 최적화하여, 합성된 이미지의 스타일을 이미지-형상 생성기 학습에 사용된 렌더링 분포와 일치시킨다.
- 텍스트 프롬프트와 렌더링된 이미지 간의 CLIP 가이던스 손실을 사용하여 NeRF를 최적화하면서, 초기 형상의 변형을 방지하기 위해 3D 사전 지식 유지 손실을 적용한다.
- 3D 사전 지식 유지 손실 $\mathcal{L}_{\text{prior}}$ 는 초기 형상 임베딩과 최적화된 형상 임베딩 간의 L2 거리로 정의되며, 사전 지식의 구조 유지에 기여한다.
- 프레임워크는 CLIP-Forge의 텍스트 프롬프트를 사용하여 학습 및 평가되며, 평가 지표로 FID와 CLIP 검색 정밀도가 사용된다.
![Figure 1 : By utilizing 3D shape priors and powerful text-to-image diffusion models, our Dream3D can generate 3D content that exhibits superior visual quality and shape accuracy in accordance with the text prompt when compared to PureCLIPNeRF [ 25 ] .](https://ar5iv.labs.arxiv.org/html/2212.14704/assets/x1.png)
실험 결과
연구 질문
- RQ1명시적인 3D 형상 사전 지식이 제로샷 텍스트-3D 합성의 구조 정확도와 시각적 품질을 크게 향상시킬 수 있는가?
- RQ2형상 렌더링의 스타일을 일치시키기 위해 텍스트-이미지 확산 모델을 미세조정하면 도메인 갭이 감소하고 3D 형상 생성 품질이 향상되는가?
- RQ3학습 가능한 프롬프트와 공동 최적화는 텍스트-이미지 생성을 이미지-형상 생성기 학습에 사용된 이미지 분포와 일치시키는 데 얼마나 효과적인가?
- RQ43D 사전 지식 유지 손실이 CLIP 가이던스 기반 NeRF 최적화 중 구조적 열화를 어느 정도 방지하는가?
- RQ5확산 기반 텍스트-형상 생성 파이프라인은 CLIP 기반 또는 오토에코더 기반 방법보다 다양하고 고해상도의 3D 형상을 더 잘 생성할 수 있는가?
주요 결과
- Dream3D는 ShapeNet 벤치마크에서 FID가 12.3으로 CLIP-Forge의 15.7보다 낮아, 3D 형상 생성에서 뛰어난 이미지 정밀도를 입증한다.
- 절단 실험 결과, 3D 형상 사전 지식을 제거할 경우 CLIP 검색 정밀도가 심각하게 떨어지며, 이는 최적화 안정성과 성능에서의 핵심적 역할을 확인한다.
- Stable Diffusion 모델을 미세조정하면 원본 모델을 사용한 경우 대비 FID가 1.2점 향상되어 스타일 도메인 갭 감소 효과를 입증한다.
- 3D 사전 지식 유지 손실 $\mathcal{L}_{\text{prior}}$ 는 최적화 과정에서 형상 왜곡과 불연속성을 방지하며, 정성적 비교를 통해 시각적으로 확인되었다.
- 3D 사전 지식 없이 최적화할 경우 CLIP 검색 정밀도가 22% 감소하여, 구조적 초기화의 중요성을 강조한다.
- 233개의 프롬프트에 걸쳐 정성적·정량적 결과를 통해 검증된 바, 이 방법은 높은 시각적 품질과 정확한 기하 구조를 가진 다양하고 상상력이 풍부한 3D 형상을 생성한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.