[논문 리뷰] Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content Creation
Fantasia3D는 텍스트-투-3D 생성에서 기하학과 외관을 분리하여 DMTet 기반의 하이브리드 기하 표현과 공간적으로 가변하는 BRDF 외관 모델을 사용함으로써 고품질의 기하학과 사진실사 렌더링을 가능하게 한다. 렌더링된 노말 맵을 형상 입력으로 활용하고 사전 학습된 확산 모델에 BRDF 매개변수를 학습하여 현실적인 재질을 구현한다.
Automatic 3D content creation has achieved rapid progress recently due to the availability of pre-trained, large language models and image diffusion models, forming the emerging topic of text-to-3D content creation. Existing text-to-3D methods commonly use implicit scene representations, which couple the geometry and appearance via volume rendering and are suboptimal in terms of recovering finer geometries and achieving photorealistic rendering; consequently, they are less effective for generating high-quality 3D assets. In this work, we propose a new method of Fantasia3D for high-quality text-to-3D content creation. Key to Fantasia3D is the disentangled modeling and learning of geometry and appearance. For geometry learning, we rely on a hybrid scene representation, and propose to encode surface normal extracted from the representation as the input of the image diffusion model. For appearance modeling, we introduce the spatially varying bidirectional reflectance distribution function (BRDF) into the text-to-3D task, and learn the surface material for photorealistic rendering of the generated surface. Our disentangled framework is more compatible with popular graphics engines, supporting relighting, editing, and physical simulation of the generated 3D assets. We conduct thorough experiments that show the advantages of our method over existing ones under different text-to-3D task settings. Project page and source codes: https://fantasia3d.github.io/.
연구 동기 및 목표
- 텍스트 프롬프트로부터 자동 3D 자산 생성을 고급 표면 품질과 재질과 함께 촉진한다.
- 정교한 기하학과 사진실사 텍스처를 더 잘 복원하기 위해 기하학과 외관 학습을 분리한다.
- 명시적 표면 변형과 차분 렌더링을 가능하게 하기 위해 하이브리드 표면 표현(DMTet)을 활용한다.
- 현실적인 표면 재질을 학습하기 위해 공간적으로 가변하는 BRDF 모델을 도입한다.
- 재조명, 편집, 물리 시뮬레이션을 위한 그래픽 엔진과의 호환성을 보장한다.
제안 방법
- 변형 가능한 사면체 격자와 차분 가능한 메시 추출을 갖춘 하이브리드 기하 표현으로 DMTet을 사용한다.
- 표면 법선 맵(초기에 객체 마스크를 포함)을 사전 학습된 이미지 확산 모델의 형태 입력으로 SDS 손실을 통해 렌더링하고 인코딩한다.
- MLP에 의해 학습되는 BRDF 기반 외관 모델을 도입하여 확산 성분, 거칠기/금속성, 법선 변화 항을 물리 기반 렌더링에 대해 출력한다.
- 사전 학습된 Stable Diffusion 모델을 사용하여 Score Distillation Sampling(SDS)으로 기하학 및 외관 모델을 학습한다.
- 3D 타원체 또는 사용자가 제공한 형태에서 기하학을 초기화하고 기하학 및 텍스처 최적화를 통해 거친 단계에서 세밀한 단계로 반복적으로 개선한다.
- 이음새를 줄이고 렌더 현실감을 높이기 위해 UV 에지 패딩이 포함된 텍스처 매핑 파이프라인을 제공한다.
실험 결과
연구 질문
- RQ1디스엔탱글드 기하학-외관 학습이 얽힌( entangled ) 또는 NeRF 기반 접근법에 비해 텍스트-3D 자산의 품질을 향상시킬 수 있는가?
- RQ2공간적으로 가변하는 BRDF를 도입하는 것이 생성 표면의 사진실사 렌더링 및 재질 충실도를 높이는가?
- RQ3노멀 맵 기반의 형태 인코딩 입력을 확산 가이드로 사용하는 것이 색상 기반 인코딩보다 더 미세한 기하 복원을 제공하는가?
- RQ4표준 그래픽 엔진에서의 편집, 재조명 및 물리 시뮬레이션과의 호환성이 있는가?
주요 결과
- Fantasia3D는 제로샷 및 사용자 주도 설정에서 기하학 품질과 외관 현실성 모두에서 기존 방법을 능가한다.
- DMTet을 활용한 기하-외관 분리 학습은 BRDF 재질을 통해 미세한 표면 복원과 사진실사 렌더링을 가능하게 한다.
- 렌더링된 노멀 맵을 확산 유도 시 입력으로 사용하는 것이 색상 기반 입력보다 기하학 품질을 향상시킨다.
- BRDF 기반 외관 모델링은 확산만 사용하는 대안보다 더 현실적인 조명 및 반사를 제공한다.
- 본 방법은 Blender와 같은 표준 그래픽 엔진에서 재조명, 편집 및 물리 시뮬레이션을 지원한다.
- 기하학은 사용자 제공 형태나 타원체에서 초기화할 수 있어 사용자 주도 생성을 유연하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.