Skip to main content
QUICK REVIEW

[논문 리뷰] InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior

Zhiheng Liu, Hao Ouyang|arXiv (Cornell University)|2024. 04. 17.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

InFusion은 3D 가우시안 복원에 대한 새로운 방법을 제안하며, 복원된 깊이 맵을 기반으로 한 확산 사전 모델을 활용하여 고해상도이고 사실적인 3D 시점 복원을 구현한다. 이미지 조건부 깊이 복원을 통해 3D 가우시안을 초기화함으로써 기존 방법에 비해 약 20배 빠른 추론 속도와 뛰어난 시각적 품질을 달성하여, 사용자가 정의한 텍스처나 삽입된 객체를 포함한 3D 시점의 효율적이고 인터랙티브한 편집을 가능하게 한다.

ABSTRACT

3D Gaussians have recently emerged as an efficient representation for novel view synthesis. This work studies its editability with a particular focus on the inpainting task, which aims to supplement an incomplete set of 3D Gaussians with additional points for visually harmonious rendering. Compared to 2D inpainting, the crux of inpainting 3D Gaussians is to figure out the rendering-relevant properties of the introduced points, whose optimization largely benefits from their initial 3D positions. To this end, we propose to guide the point initialization with an image-conditioned depth completion model, which learns to directly restore the depth map based on the observed image. Such a design allows our model to fill in depth values at an aligned scale with the original depth, and also to harness strong generalizability from largescale diffusion prior. Thanks to the more accurate depth completion, our approach, dubbed InFusion, surpasses existing alternatives with sufficiently better fidelity and efficiency under various complex scenarios. We further demonstrate the effectiveness of InFusion with several practical applications, such as inpainting with user-specific texture or with novel object insertion.

연구 동기 및 목표

  • 복잡한 시점에서 기하학적 구조와 텍스처가 손실된 상황에서 고정밀도 3D 가우시안 복원 문제를 해결하기 위해.
  • 사전 훈련된 확산 모델에서 유도된 깊이 복원을 활용하여 3D 점 초기화의 정확도와 효율성을 향상시키기 위해.
  • 사용자가 정의한 텍스처 복원 및 새로운 객체 삽입과 같은 인터랙티브 3D 편집 기능을 3D 가우시안 시점에서 가능하게 하기 위해.
  • 기존 방법들이 열악한 3D 점 초기화로 인해 흐릿한 텍스처와 느린 수렴 속도 문제를 겪는 것을 극복하기 위해.

제안 방법

  • 이 방법은 사전 훈련된 잠재 확산 모델(LDM)을 사용하여 원본 시점 기하학과 일치하는 고품질의 깊이 맵을 생성하는 이미지 조건부 깊이 복원을 수행한다.
  • 복원된 깊이 맵은 3D 공간으로 역투영되어 시점과 기하학적 일관성을 확보한 초기 3D 가우시안 점을 생성한다.
  • 복잡한 가림을 처리하기 위해 다중 시점 정보를 활용하는 점진적 정밀화 전략을 적용한다.
  • 사용자가 기준 이미지를 수정할 수 있도록 허용함으로써 인터랙티브 편집을 지원하며, 이는 직접적으로 복원된 3D 영역의 텍스처와 외관에 영향을 준다.
  • 특히 객체 경계나 복잡한 구조에서의 깊이 복원 정확도 향상을 위해 확산 모델의 강력한 생성 사전을 통합한다.
  • 깊이 복원과 이후 3D 가우시안 렌더링 품질을 동시에 최적화하기 위해 엔드 투 엔드로 훈련함으로써 아티팩트와 이질감을 최소화한다.

실험 결과

연구 질문

  • RQ1확산 기반 깊이 복원 모델은 기존 방법에 비해 3D 가우시안 복원의 정밀도와 효율성에서 뚜렷한 향상을 이끌 수 있는가?
  • RQ2사전 훈련된 확산 모델에서 유도된 깊이 복원은 생성된 3D 가우시안의 기하학적 일관성과 시각적 품질에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 사용자 정의 텍스처 복원 및 객체 삽입과 같은 인터랙티브 3D 편집 작업을 어느 정도 지원할 수 있는가?
  • RQ4점진적 다중 시점 정밀화 전략은 큰 가림이나 복잡한 기하학적 구조를 가진 시점에서 성능을 어떻게 향상시키는가?
  • RQ5확산 사전의 통합은 정방향 및 360도 시점 모두에서 구조적 객체와 배경을 견고하게 복원하는 데 기여하는가?

주요 결과

  • InFusion은 SPIn-NeRF 데이터셋에서 기준 방법 대비 최적화 시간을 20배 빠르게 하여 추론 시간을 5시간에서 40초로 단축시켰다.
  • 비교된 모든 방법들 중에서 가장 낮은 LPIPS 점수(0.421)와 FID 점수(92.62)를 기록하여 진짜 영상과의 시각적 및 통계적 유사도가 뛰어나다는 것을 보여준다.
  • 시각적 비교 결과, InFusion은 특히 다중 객체 가림 상황에서 기준 방법에 비해 더 선명한 텍스처와 더 나은 기하학적 일치를 구현한다.
  • 깊이 복원에 확산 사전을 적용함으로써 깊이 불연속성과 이질감을 크게 감소시켜 보다 일관성 있는 3D 시점 확장이 가능해졌다.
  • 기존 방법들이 고정되거나粗略한 초기화에 의존함으로써 지원하지 못하는 인터랙티브 텍스처 편집 및 객체 삽입이 가능해졌다.
  • 제거 실험 결과, 이미지 기반 복원 및 깊이 정렬 기법에 비해 확산 기반 깊이 복원이 객체 구조와 깊이 연속성을 유지하는 데 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.