Skip to main content
QUICK REVIEW

[논문 리뷰] Splatter Image: Ultra-Fast Single-View 3D Reconstruction

Stanisław Szymanowicz, Christian Rupprecht|arXiv (Cornell University)|2023. 12. 20.
Advanced Vision and Imaging인용 수 5
한 줄 요약

Splatter Image는 단일 및 少수 뷰 3D 재구성에 대해 초고속 학습 기반 방법을 제공하는 가우시안 스플래터링 기반 기법이다. 2D U-Net이 각 픽셀당 하나의 3D 가우시안을 인코딩하는 '스플래터 이미지'(가짜 이미지)를 예측한다. 이 방법은 38 FPS의 추론 속도를 달성하며, ShapeNet 및 CO3D 벤치마크에서 최신 기준(SOTA) 성능을 기록한다. 더 느린 기준 모델들보다 PSNR 및 LPIPS 측면에서 뛰어난 성능을 내며, 단일 GPU에서 효율적으로 학습된다.

ABSTRACT

We introduce the \method, an ultra-efficient approach for monocular 3D object reconstruction. Splatter Image is based on Gaussian Splatting, which allows fast and high-quality reconstruction of 3D scenes from multiple images. We apply Gaussian Splatting to monocular reconstruction by learning a neural network that, at test time, performs reconstruction in a feed-forward manner, at 38 FPS. Our main innovation is the surprisingly straightforward design of this network, which, using 2D operators, maps the input image to one 3D Gaussian per pixel. The resulting set of Gaussians thus has the form an image, the Splatter Image. We further extend the method take several images as input via cross-view attention. Owning to the speed of the renderer (588 FPS), we use a single GPU for training while generating entire images at each iteration to optimize perceptual metrics like LPIPS. On several synthetic, real, multi-category and large-scale benchmark datasets, we achieve better results in terms of PSNR, LPIPS, and other metrics while training and evaluating much faster than prior works. Code, models, demo and more results are available at https://szymanowiczs.github.io/splatter-image.

연구 동기 및 목표

  • 단일 단일 카메라 이미지에서 효율적인 딥러닝을 통해 실시간 고품질 3D 재구성 기능을 제공한다.
  • NeRF와 같은 암시적 3D 표현의 계산 병목 현상을 해결하기 위해 가우시안 스플래터링의 빠름과 품질을 활용한다.
  • 완전한 이미지 감독을 가능하게 하는 학습 효율적인 프레임워크를 설계하여, LPIPS와 같은 감각적 지표를 사용해 제한된 뷰 조건에서도 성능을 높인다.
  • 절대 자세가 아닌 상대 자세를 사용하는 다중 뷰 재구성으로 확장하여, 절대 자세 의존도를 제거한다.
  • 최소한의 계산 비용으로 최신 기준의 재구성 품질을 달성하며, 단일 GPU에서의 학습 및 추론을 가능하게 한다.

제안 방법

  • 이 방법은 2D U-Net 기반의 이미지-투-이미지 네트워크를 사용하여 '스플래터 이미지'—각 픽셀이 3D 가우시안의 위치, 색상, 불투명도, 형태를 인코딩하는 2D 특징 맵—를 예측한다.
  • 예측된 각 3D 가우시안은 가우시안 스플래터링을 통해 렌더링되며, 이는 588 FPS의 빠른 고품질 렌더링을 가능하게 하여 학습 병목 현상과 렌더링을 분리한다.
  • 3D 가우시안들은 2D 이미지 구조에 저장되어, 고비용 3D 연산 대신 효율적인 2D 컨볼루션을 사용할 수 있게 되어 학습 및 추론을 단순화한다.
  • 다중 뷰 입력의 경우, 여러 뷰의 예측을 공통 기준 프레임에 정렬하고 경량의 크로스뷰 어텐션 레이어를 통합하여 융합한다.
  • 학습은 L1, LPIPS, 감각적 손실의 조합을 사용하며, 각 학습 반복마다 전체 360°의 렌더링 뷰를 생성하여 시각적 현실감을 최적화한다.
  • 후처리 단계에서는 불활성 가우시안(불투명도 ≈ 0)을 제거하여 품질 손실 없이 메모리 및 렌더링 비용을 줄인다.
Figure 2 : Predicting locations. The location of each Gaussian is parameterised by depth $d$ and a 3D offset $\Delta=(\Delta_{x},\Delta_{y},\Delta_{z}$ ). The 3D Gaussians are projected to depth $d$ (blue) along camera rays (green) and moved by the 3D offset $\Delta$ (red).
Figure 2 : Predicting locations. The location of each Gaussian is parameterised by depth $d$ and a 3D offset $\Delta=(\Delta_{x},\Delta_{y},\Delta_{z}$ ). The 3D Gaussians are projected to depth $d$ (blue) along camera rays (green) and moved by the 3D offset $\Delta$ (red).

실험 결과

연구 질문

  • RQ1간단한 2D 네트워크를 사용해 3D 가우시안을 예측하는 방식으로 가우시안 스플래터링을 단일 뷰 3D 재구성에 효과적으로 적용할 수 있는가?
  • RQ22D 이미지-투-이미지 네트워크가 3D 가우시안 혼합으로 매핑되면, 단일 뷰에서 고해상도 360° 재구성 가능성이 있는가?
  • RQ3초저지연 추론 및 학습 지연을 유지하면서도 최신 기준의 재구성 품질을 달성할 수 있는가?
  • RQ4전체 뷰 렌더링을 통한 감각적 손실(LPIPS 등) 사용이 부분 뷰 감독 대비 일반화 성능을 얼마나 향상시키는가?
  • RQ5절대 자세가 필요 없이 상대 자세만으로도 다중 뷰 어텐션 기반 융합이 예측 품질 향상에 얼마나 기여하는가?

주요 결과

  • Splatter Image는 단일 GPU에서 38 FPS의 추론 속도를 달성하여, 테스트 시 효율성에서 PixelNeRF 및 VisionNeRF보다 1000배 이상 빠르다.
  • 이 방법은 단일 A6000 GPU에서 7일 만에 효율적으로 학습되며, ShapeNet 및 CO3D 벤치마크에서 최신 기준 PSNR 및 LPIPS 성능을 기록한다. 이는 VisionNeRF(16개의 A100 GPU를 사용해 5일 동안 학습)를 능가한다.
  • ShapeNet-SRN 벤치마크에서 Splatter Image는 PSNR 28.98, LPIPS 0.033을 기록했으며, PixelNeRF(PSNR 28.45, LPIPS 0.037) 및 VisionNeRF(PSNR 28.71, LPIPS 0.037)를 상회한다. 이는 훨씬 낮은 지연 시간을 기록한다.
  • 모델은 새로운 시야로의 일반화가 뛰어나다. 추론 시 한쪽면만 관측되더라도, 훈련 과정에서의 강력한 인덕티브 바이어스 덕분에 전체 360° 객체를 고품질로 재구성한다.
  • 후처리 단계에서 50% 이상의 가우시안이 불활성화(불투명도 ≈ 0)되어 품질 손실 없이 효율적으로 제거되며, 이는 렌더링 속도 및 메모리 효율성을 향상시킨다.
  • 모델은 캐논리컬 또는 절대 카메라 자세가 필요 없으며, 상대 자세만으로도 작동한다. 이는 배포 용이성 향상과 자세 변동에 대한 강건성 향상에 기여한다.
Figure 3 : ShapeNet-SRN. Our method is able to represent difficult geometries ( e.g . , windshield in yellow car), and preserve details of the conditioning image (front of red car), occluded parts (left chair), thin structures (middle chair) and complex shapes (right chair).
Figure 3 : ShapeNet-SRN. Our method is able to represent difficult geometries ( e.g . , windshield in yellow car), and preserve details of the conditioning image (front of red car), occluded parts (left chair), thin structures (middle chair) and complex shapes (right chair).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.