Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Vocabulary 3D Diffusion Model with Transformer

Ziang Cao, Fangzhou Hong|arXiv (Cornell University)|2023. 09. 14.
3D Shape Modeling and AnalysisEngineering인용 수 3
한 줄 요약

이 논문은 대용량 용어집을 위한 3D 객체 생성을 위해 삼중면 기반의 3D 확산 모델인 DiffTF를 제안한다. 3D 인식 트랜스포머를 활용하여 일반화된 및 전문화된 3D 특징을 추출하며, 공유된 교차 평면 어텐션과 3D 인식 인코더/디코더를 통해 고도로 정교한 기하학적 및 질감적 정확도를 달성하여, 216개의 다양한 실제 카테고리에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Creating diverse and high-quality 3D assets with an automatic generative model is highly desirable. Despite extensive efforts on 3D generation, most existing works focus on the generation of a single category or a few categories. In this paper, we introduce a diffusion-based feed-forward framework for synthesizing massive categories of real-world 3D objects with a single generative model. Notably, there are three major challenges for this large-vocabulary 3D generation: a) the need for expressive yet efficient 3D representation; b) large diversity in geometry and texture across categories; c) complexity in the appearances of real-world objects. To this end, we propose a novel triplane-based 3D-aware Diffusion model with TransFormer, DiffTF, for handling challenges via three aspects. 1) Considering efficiency and robustness, we adopt a revised triplane representation and improve the fitting speed and accuracy. 2) To handle the drastic variations in geometry and texture, we regard the features of all 3D objects as a combination of generalized 3D knowledge and specialized 3D features. To extract generalized 3D knowledge from diverse categories, we propose a novel 3D-aware transformer with shared cross-plane attention. It learns the cross-plane relations across different planes and aggregates the generalized 3D knowledge with specialized 3D features. 3) In addition, we devise the 3D-aware encoder/decoder to enhance the generalized 3D knowledge in the encoded triplanes for handling categories with complex appearances. Extensive experiments on ShapeNet and OmniObject3D (over 200 diverse real-world categories) convincingly demonstrate that a single DiffTF model achieves state-of-the-art large-vocabulary 3D object generation performance with large diversity, rich semantics, and high quality.

연구 동기 및 목표

  • 실제 세계의 다양한 카테고리에 걸쳐 고품질의 3D 객체를 생성하는 데 도전한다.
  • 이전의 단일 카테고리 또는 좁은 용어집을 가진 3D 생성 모델의 한계를 극복한다.
  • 정확도와 계산 비용의 균형을 잡은 효율적이고 표현력 있는 3D 표현 방식을 개발한다.
  • 일반화된 3D 지식과 전문화된 특징을 통합하여 극단적인 기하학적 및 질감적 다양성을 처리한다.
  • 다양한 3D 객체 생성을 위한 부드럽고 의미적으로 유의미한 잠재 공간 보간을 가능하게 한다.

제안 방법

  • 적합 속도, 정확도 및 수렴 안정성을 향상시키기 위해 정규화와 총 변동성 정규화를 적용한 개선된 삼중면 표현 방식을 채택한다.
  • 서로 다른 평면 간의 공유된 교차 평면 어텐션을 갖춘 3D 인식 트랜스포머를 제안하여 평면 간의 일반화된 3D 지식을 추출하고 카테고리별 특징과 통합한다.
  • 특징 인코딩 중 3D 공간 관계를 유지하는 3D 인식 인코더/디코더를 설계하여 의미적 및 기하학적 인식 능력을 향상시킨다.
  • 삼중면 특징에 기반한 피드포워드 확산 프레임워크를 사용하여 종단 간 3D 객체 생성을 수행하며, 고정밀 기하학적 형태와 사진 수준의 질감을 구현한다.
  • 학습 안정성과 생성 품질 향상을 위해 삼중면 특징에 강한 정규화 및 분포 제약 조건을 적용한다.
  • 명시적 삼중면 특징과 암시적 확산 모델링을 융합한 하이브리드 3D 표현 방식을 활용하여 효율적이고 고정밀한 생성을 실현한다.

실험 결과

연구 질문

  • RQ1단일 생성 모델이 200개 이상의 실제 세계 카테고리에서 기하학적 및 질감적 정확도가 높은 다양한 3D 객체를 효과적으로 생성할 수 있는가?
  • RQ2극도로 다양한 카테고리 수준의 변동성을 다루기 위해 일반화된 3D 지식을 효과적으로 추출하고 전문화된 특징과 통합할 수 있는가?
  • RQ3삼중면 평면 간의 3D 인식 어텐션은 표준 2D 자기어텐션 대비 특징 표현에 얼마나 향상되는가?
  • RQ4삼중면 정규화 및 정규화가 3D 확산 생성의 안정성과 품질에 어떤 영향을 미치는가?
  • RQ5모델의 잠재 공간이 다양한 3D 객체 간에 부드럽고 의미적으로 의미 있는 보간을 지원할 수 있는가?

주요 결과

  • DiffTF는 삼나무송이와 피타야와 같은 복잡한 물체를 포함한 216개의 다양한 실제 카테고리로 구성된 OmniObject3D 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • OmniObject3D에서 DiffTF는 프레셰 인ception 거리(FID) 25.36과 KID 0.8%를 기록하여 이전 방법들을 크게 능가한다.
  • 절단 실험 결과, 삼중면 정규화 및 정규화가 FID를 125.21에서 52.35로 감소시켜 모델의 안정성과 품질에 결정적인 역할을 한다는 것을 입증한다.
  • 기본 모델 대비 공유된 교차 평면 어텐션을 갖춘 3D 인식 트랜스포머가 FID를 13.78점 향상시켜 일반화된 3D 지식을 효과적으로 캡처한다는 점을 입증한다.
  • 정성적 결과에서는 복잡한 카테고리일수록 풍부한 의미적 세부 정보, 현실적인 질감 및 토폴로지적으로 타당한 기하학적 형태를 갖춘 생성 객체를 확인할 수 있다.
  • 잠재 공간 보간은 다양한 객체 간에 의미적으로 부드러운 전이를 생성하여, 모델이 분리되고 의미 있는 표현을 학습할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.