Skip to main content
QUICK REVIEW

[논문 리뷰] LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation

Jiaxiang Tang, Zhaoxi Chen|arXiv (Cornell University)|2024. 02. 07.
Computer Graphics and Visualization Techniques인용 수 4
한 줄 요약

LGM는 텍스트 또는 단일 시각 이미지에서 5초 이내로 고해상도 3D 콘텐츠를 생성하는 대규모 다중 시각 가우시안 모델을 제안한다. 비대칭 U-Net을 사용해 다중 시각 이미지에서 3D 가우시안를 예측하고, 가우시안를 미분 가능 렌더링을 통해 융합한다. 이 방법은 최대 65,536개의 가우시안와 함께 512×512 훈련 해상도를 달성하여 이전의 피드포워드 3D 생성 모델에 비해 해상도와 속도를 크게 향상시킨다.

ABSTRACT

3D content creation has achieved significant progress in terms of both quality and speed. Although current feed-forward models can produce 3D objects in seconds, their resolution is constrained by the intensive computation required during training. In this paper, we introduce Large Multi-View Gaussian Model (LGM), a novel framework designed to generate high-resolution 3D models from text prompts or single-view images. Our key insights are two-fold: 1) 3D Representation: We propose multi-view Gaussian features as an efficient yet powerful representation, which can then be fused together for differentiable rendering. 2) 3D Backbone: We present an asymmetric U-Net as a high-throughput backbone operating on multi-view images, which can be produced from text or single-view image input by leveraging multi-view diffusion models. Extensive experiments demonstrate the high fidelity and efficiency of our approach. Notably, we maintain the fast speed to generate 3D objects within 5 seconds while boosting the training resolution to 512, thereby achieving high-resolution 3D content generation.

연구 동기 및 목표

  • 기존 3D 생성 모델의 낮은 훈련 해상도와 높은 계산 비용 문제를 해결하기 위해.
  • 고해상도 3D 생성에서 트리플레인 기반 표현과 트랜스포머 기반 아키텍처의 비효율성을 극복하기 위해.
  • 피드포워드 및 엔드 투 엔드 학습 가능한 프레임워크를 통해 텍스트 또는 단일 시각 이미지에서 빠르고 고정밀도 3D 생성을 가능하게 하기 위해.
  • 데이터 증강을 통해 실물과 합성된 다중 시각 이미지 간의 도메인 갭에 대한 강건성을 향상시키기 위해.
  • 후속 응용을 위한 생성된 3D 가우시안에 일반적인 메쉬 추출 파이프라인을 제공하기 위해.

제안 방법

  • 모델은 표현력 있고 효율적인 3D 표현으로 다중 시각 가우시안 특징을 사용하여 압축된 시나리오 표현과 빠른 렌더링을 가능하게 한다.
  • 비대칭 U-Net 기반 아키텍처가 다중 시각 이미지를 처리하여 3D 가우시안 특징을 예측하며, 깊은 레이어에서 주목적 블록을 통해 다중 시각 특징 융합을 향상시킨다.
  • 다양한 렌더링 기법을 적용해 고해상도 신규 시각을 사용해 모델을 지도 학습시키며, 이미지 수준의 지도를 통해 엔드 투 엔드 학습을 가능하게 한다.
  • 모델은 텍스트에서 이미지로 또는 단일 이미지에서 다중 시각으로의 변환을 위해 사전 학습된 텍스트-이미지 또는 이미지-다중 시각 디퓨전 모델을 활용하여 네 개의 입력 시각을 생성한다.
  • 실물 3D 렌더링 시각과 디퓨전 모델에서 생성된 다중 시각 이미지 간의 도메인 갭을 메우기 위해 두 가지 데이터 증강 전략을 도입한다.
  • 일반적인 메쉬 추출 알고리즘이 생성된 3D 가우시안를 부드럽고 텍스처가 있는 다각형 메쉬로 변환하여 표준 3D 파이프라인과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1피드포워드 3D 생성 모델이 512×512 해상도를 달성하면서도 5초 이내의 인fer런스 속도를 유지할 수 있는가?
  • RQ2비대칭 U-Net 기반 아키텍처를 사용한 다중 시각 가우시안 융합이 트리플레인 또는 NeRF 기반 방법에 비해 기하학적 및 텍스처 세부 정보를 얼마나 잘 유지하는가?
  • RQ3디퓨전 모델에서 유도된 합성 다중 시각 이미지로 훈련할 경우, 데이터 증강 전략이 얼마나 효과적으로 도메인 갭에 대한 강건성을 향상시키는가?
  • RQ4제안된 방법이 고정밀도로 텍스트-3D 및 이미지-3D 생성 작업 모두에 일반화 가능한가?
  • RQ53D 가우시안가 고해상도 텍스처가 있는 메쉬로 얼마나 잘 변환되는가? 실세계 응용에 적합한가?

주요 결과

  • LGM 모델은 최대 65,536개의 점을 가진 3D 가우시안를 생성하며, 피드포워드 3D 생성의 해상도 한계를 크게 높였다.
  • 모델은 약 5초 내로 3D 콘텐츠 생성을 달성하여 이전의 피드포워드 모델보다 해상도를 높이면서도 고속을 유지한다.
  • 사용자 연구 결과, LGM이 생성한 3D 가우시안는 이미지 일致성과 전체 품질에서 베이스라인을 능가하며, 20명의 자원자로부터 600개의 유효 점수를 확보했다.
  • 절단 실험 결과, 다중 시각 입력이 3D 기하학적 재구성에 도움이 되며, 단일 시각 모델은 뒷면이 흐릿하고 일관성 없음을 확인했다.
  • 데이터 증강 전략은 플로터와 기하학적 아티팩트를 크게 감소시켜, 다중 시각 이미지 합성에서의 도메인 갭에도 불구하고 3D 일관성을 향상시켰다.
  • 메쉬 추출 알고리즘이 3D 가우시안를 부드럽고 텍스처가 있는 메쉬로 성공적으로 변환하여 표준 3D 파이프라인과의 호환성을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.