Skip to main content
QUICK REVIEW

[논문 리뷰] Progressive3D: Progressively Local Editing for Text-to-3D Content Creation with Complex Semantic Prompts

Xinhua Cheng, Tianyu Yang|arXiv (Cornell University)|2023. 10. 18.
Computer Graphics and Visualization Techniques인용 수 4
한 줄 요약

Progressive3D는 복잡한 의미적 프롬프트 하에서 정확한 텍스트 기반 3D 생성을 위한 일반적인 프레임워크를 제안한다. 이는 생성 과정을 국소화되고 점진적인 편집 단계로 분해함으로써 구현된다. 영역 유도 제약 조건과 겹치는 의미적 구성 요소 억제(Overlapped Semantic Component Suppression, OSCS)를 사용하여 의미 일치도를 향상시키며, 다양한 3D 표현 방식에서 복잡한 프롬프트에 대해 최신 기술 수준의 성능을 달성한다. 기준 방법 대비 83.2%의 인간 선호도를 기록하였다.

ABSTRACT

Recent text-to-3D generation methods achieve impressive 3D content creation capacity thanks to the advances in image diffusion models and optimizing strategies. However, current methods struggle to generate correct 3D content for a complex prompt in semantics, i.e., a prompt describing multiple interacted objects binding with different attributes. In this work, we propose a general framework named Progressive3D, which decomposes the entire generation into a series of locally progressive editing steps to create precise 3D content for complex prompts, and we constrain the content change to only occur in regions determined by user-defined region prompts in each editing step. Furthermore, we propose an overlapped semantic component suppression technique to encourage the optimization process to focus more on the semantic differences between prompts. Extensive experiments demonstrate that the proposed Progressive3D framework generates precise 3D content for prompts with complex semantics and is general for various text-to-3D methods driven by different 3D representations.

연구 동기 및 목표

  • 복잡하고 상호 연관된 속성을 가진 여러 개체를 묘사하는 텍스트 프롬프트가 주어졌을 때 정확한 3D 콘텐츠 생성의 과제를 해결하기 위해.
  • 기존의 텍스트 기반 3D 생성 방법들이 복잡한 의미적 맥락에서 객체 누락, 속성 불일치, 품질 저하 등의 문제를 겪는 것을 해결하기 위해.
  • 다양한 3D 신경망 표현 방식과 최적화 전략과 호환 가능한 일반화 가능한 프레임워크를 개발하기 위해.
  • 점진적이고 국소적인 편집을 통해 생성된 3D 콘텐츠와 복잡한 프롬프트 간의 의미 일致성을 향상시키기 위해.

제안 방법

  • 사용자가 정의한 영역 프롬프트에 따라 복잡한 텍스트 기반 3D 생성을 국소적 편집 단계의 시퀀스로 분해한다.
  • 편집 영역 외부의 콘텐츠를 유지하기 위한 일致성 제약 조건과 빈 공간에서 기하 구조를 생성하도록 유도하는 초기화 제약 조건을 적용한다.
  • 원본 프롬프트와 대상 프롬프트 간의 의미적 차이를 고립하고 강조하기 위해 겹치는 의미적 구성 요소 억제(Overlapped Semantic Component Suppression, OSCS)를 도입한다.
  • 지정된 영역만 편집하도록 중점화하면서 다른 영역에 간섭을 최소화하는 잠재 확산 기반 최적화 프로세스를 사용한다.
  • 어텐션 마스킹을 통한 최적화 프로세스 가이드를 위해 CLIP 기반 임베딩을 활용하여 의미적 차이를 계산한다.
  • NeRF, SDF, DMTet 등 다양한 3D 표현 방식을 지원하여 기존의 텍스트 기반 3D 모델과 넓은 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1점진적이고 국소적인 편집은 복잡한 프롬프트에 대한 텍스트 기반 3D 생성에서 의미 일치도를 향상시키는가?
  • RQ2겹치는 속성이 많은 복잡한 프롬프트에서 Overlapped Semantic Component Suppression(осс)는 공통 속성으로 인한 혼란을 얼마나 효과적으로 줄이는가?
  • RQ3제안된 프레임워크는 다양한 3D 신경망 표현 방식과 최적화 파이프라인에 일반화되는가?
  • RQ4점진적 편집은 직접 미세조정 대비 기하학적 일致성과 속성 일치도를 얼마나 잘 유지하는가?
  • RQ5일치성 제약 조건, 초기화 제약 조건, OSCS 등의 개별 구성 요소가 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • CSP-100 벤치마크에서 Progressive3D는 0.474의 B-VQA 점수와 0.609의 mGPT-CoT 점수를 기록하여 기준 방법인 DreamTime(0.227 및 0.522)를 크게 앞서며 성능을 뛰어나게 하였다.
  • 사용자 선호도 조사에서 83.2%의 사용자가 Progressive3D가 생성한 결과를 DreamTime보다 선호하여, 복잡한 프롬프트와의 강한 시각적 일치도를 입증하였다.
  • 제거 실험을 통해 초기화 제약 조건과 OSCS를 함께 사용할 경우 가장 높은 성능(0.474 B-VQA 점수)을 기록함을 확인하였다.
  • 증가하는 억제 가중치를 가진 OSCS는 의미적 차이에 대한 집중도를 향상시켜 객체 누락과 속성 불일치를 감소시켰다.
  • 정성적 및 정량적 분석을 통해 복잡한 프롬프트에서의 객체 누락 및 속성 불일치 문제를 효과적으로 완화함을 입증하였다.
  • NeRF, SDF, DMTet 등 다양한 3D 표현 방식에서 프레임워크가 일반화됨을 확인하여 광범위한 적용 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.