[논문 리뷰] Generative AI meets 3D: A Survey on Text-to-3D in AIGC Era
AIGC 시대의 텍스트-3D 방법에 관한 포괄적 고찰로, 3D 데이터 표현, 기초 기술, CLIP 및 확산 priors, 3D 응용 및 도전과제를 다룹니다.
Generative AI has made significant progress in recent years, with text-guided content generation being the most practical as it facilitates interaction between human instructions and AI-generated content (AIGC). Thanks to advancements in text-to-image and 3D modeling technologies, like neural radiance field (NeRF), text-to-3D has emerged as a nascent yet highly active research field. Our work conducts a comprehensive survey on this topic and follows up on subsequent research progress in the overall field, aiming to help readers interested in this direction quickly catch up with its rapid development. First, we introduce 3D data representations, including both Structured and non-Structured data. Building on this pre-requisite, we introduce various core technologies to achieve satisfactory text-to-3D results. Additionally, we present mainstream baselines and research directions in recent text-to-3D technology, including fidelity, efficiency, consistency, controllability, diversity, and applicability. Furthermore, we summarize the usage of text-to-3D technology in various applications, including avatar generation, texture generation, scene generation and 3D editing. Finally, we discuss the agenda for the future development of text-to-3D.
연구 동기 및 목표
- 3D 데이터 표현(Euclidean 및 비-Euclidean)을 설명하고 텍스트-투-3D에서의 관련성을 설명합니다.
- NeRF, CLIP, 및 diffusion models를 포함한 텍스트-투-3D를 가능하게 하는 기초 기술을 설명합니다.
- 이미지-텍스트 priors를 활용하는 방법과 이것이 3D 생성에 어떻게 기여하는지에 대해 요약합니다.
- 아바타, 텍스처, 장면 및 모양 변환과 같은 텍스트-투-3D 응용 및 실용적 도전을 조사합니다.
- 현재 텍스트-투-3D 방법에서 충실도, 속도, 일관성, 제어 가능성 및 적용성 이슈를 논의하고 이를 완화하는 방법을 제시합니다.
제안 방법
- 3D 데이터 표현을 Euclidean (voxel grids, multi-view images)와 non-Euclidean (meshes, point clouds, neural fields)로 분류합니다.
- NeRF-based 장면 표현 및 3D 합성을 위한 미분 가능 렌더링을 설명합니다.
- CLIP-based 텍스트-이미지 priors와 3D 생성 가이드에서의 그들의 역할을 설명합니다.
- diffusion-model-based priors와 이들이 NeRFs 또는 명시적 3D 표현에 어떻게 통합되는지 요약합니다.
- DreamFusion, Magic3D, CLIP-NeRF, CLIP-Mesh, DreamFields 등과 같은 선구적 및 후속 텍스트-투-3D 방법을 검토합니다.
- priors와 최적화 또는 latent diffusion을 통한 텍스트 프롬프트에서 최적화된 3D 출력까지의 일반적인 파이프라인을 개요합니다.

실험 결과
연구 질문
- RQ1무엇이 3D 데이터 표현으로 텍스트-투-3D 작업에 가장 효과적이거나 실용적인가?
- RQ2NeRF, CLIP, 및 diffusion priors가 텍스트로 가이드된 3D 생성에 어떻게 기여하는가?
- RQ3텍스트-투-3D의 주요 아키텍처 및 데이터상의 도전과제는 무엇이며, 최근 연구들이 데이터 부족 문제를 어떻게 다루는가?
- RQ4아바타, 텍스처, 장면 및 변환에서 텍스트-투-3D의 주요 응용 및 한계는 무엇인가?
- RQ5현재의 텍스트-투-3D 방법에서 충실도, 속도, 일관성, 및 제어 가능성 이슈는 무엇이며 이를 어떻게 완화할 수 있는가?
주요 결과
- 텍스트-투-3D는 Euclidean과 비-Euclidean 표현의 혼합에 의존하며, 신경장(예: NeRF, SDF)이 유연하고 고해상도 출력이 가능하게 합니다.
- 사전 학습된 텍스트-이미지 diffusion 모델 및 CLIP은 제한된 3D 데이터로도 텍스트 가이드를 통한 3D 합성을 가능하게 하는 강력한 priors를 제공합니다.
- 선구적 방법(DreamFusion, Magic3D, CLIP-NeRF, DreamFields)은 이미지-텍스트 priors를 사용하여 텍스트 프롬프트에서 3D 콘텐츠를 최적화하는 가능성을 시연하며, 종종 NeRF 기반 표현을 통해 구현됩니다.
- 후속 연구는 생성 속도 향상, 3D 일관성 개선, 다중 클래스 및 편집 가능한 3D 콘텐츠(예: 3D-CLFusion, CLIP-Sculptor, 3DFuse, CompoNeRF) 등에 초점을 맞춥니다.
- 응용 분야는 텍스트-가이드 3D 아바타, 텍스처, 장면 생성 및 형태 변환에 걸쳐 있으며, 충실도, 속도 및 의미적 일관성에 지속적인 도전이 남아 있습니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.