[논문 리뷰] FSGS: Real-Time Few-shot View Synthesis using Gaussian Splatting
FSGS는 3D 가우시안 스 Plattin을 사용하여 실시간 소수의 새로운 시점 렌더링 프레임워크를 제안한다. 최소 3장의 시점으로도 사진 수준의 렌더링을 가능하게 하며, 희박한 SfM 점을 밀도 높게 만들기 위해 Proximity-guided Gaussian Unpooling을 도입하고, 온라인으로 증강된 시점을 통해 단일 시점 깊이 사전 지식을 통합함으로써 모바일로 촬영한 데이터셋에서 최신 기술 수준의 PSNR(19.54)와 SSIM(0.539)를 달성하면서도 203 FPS의 렌더링 속도를 구현한다.
Novel view synthesis from limited observations remains an important and persistent task. However, high efficiency in existing NeRF-based few-shot view synthesis is often compromised to obtain an accurate 3D representation. To address this challenge, we propose a few-shot view synthesis framework based on 3D Gaussian Splatting that enables real-time and photo-realistic view synthesis with as few as three training views. The proposed method, dubbed FSGS, handles the extremely sparse initialized SfM points with a thoughtfully designed Gaussian Unpooling process. Our method iteratively distributes new Gaussians around the most representative locations, subsequently infilling local details in vacant areas. We also integrate a large-scale pre-trained monocular depth estimator within the Gaussians optimization process, leveraging online augmented views to guide the geometric optimization towards an optimal solution. Starting from sparse points observed from limited input viewpoints, our FSGS can accurately grow into unseen regions, comprehensively covering the scene and boosting the rendering quality of novel views. Overall, FSGS achieves state-of-the-art performance in both accuracy and rendering efficiency across diverse datasets, including LLFF, Mip-NeRF360, and Blender. Project website: https://zehaozhu.github.io/FSGS/.
연구 동기 및 목표
- 최소한 3장의 입력 시점으로도 고정밀도 실시간 새로운 시점 렌더링을 달성하는 데 도전한다.
- 조금의 시점으로도 높은 학습 및 렌더링 비용을 유발하는 기존의 NeRF 기반 방법의 한계를 극복한다.
- 3D 가우시안을 사용하여 희박한 초기화 상황에서 기하학적 정확도와 시점 커버리지의 향상을 도모한다.
- 최적화 과정에서 단일 시점 깊이 사전 지식을 효과적으로 활용하여 기하학적 일致성과 과적합 방지를 유도한다.
- 모바일 VR/AR 및 자율주행 시스템과 같은 실생활 응용 분야에서의 실용적 구현을 가능하게 한다.
제안 방법
- 기존 가우시안에 가까운 위치에 새로운 가우시안을 배치함으로써 근접도 기반으로 반복적으로 3D 가우시안을 밀도 높게 만드는 Proximity-guided Gaussian Unpooling을 제안한다.
- 기존의 단일 시점 깊이 추정 모델에서 유도된 깊이 사전 지식을 가우시안 최적화 과정에 역전파할 수 있도록 가능한 깊이 래스터라이저를 도입한다.
- 학습 중 기하학적 정규화를 향상시키기 위해 온라인으로 증강된 가짜 시점을 활용하여 깊이 보조 정보를 강화한다.
- 외관과 기하학을 균형 있게 조절하기 위해 광학적 손실과 깊이 상관관계(Pearson 상관관계)를 조합한 다항 손실을 통합한다.
- 투명도와 근접도 임계값 기반으로 동적 최적화 전략을 적용하여 적응적인 밀도 증가와 정리 전략을 시행한다.
- 초기 SfM 재구성에 COLMAP를 사용하고, 실제 및 가짜 시점 입력에 대해 사전 학습된 깊이 모델을 활용해 깊이 사전 지식을 생성한다.

실험 결과
연구 질문
- RQ13D 가우시안 스 Plattin 기반 프레임워크는 소수의 시점 렌더링에서 고정밀도를 유지하면서도 실시간 렌더링 속도를 달성할 수 있는가?
- RQ2희박한 초기 SfM 점 구름을 과적합을 방지하면서도 볼 수 없는 영역까지 커버할 수 있도록 효과적으로 밀도 높게 만들 수 있는가?
- RQ3단일 시점 깊이 사전 지식이 낮은 시점 수 상황에서 기하학적 정확도와 일반화 능력을 어느 정도 향상시킬 수 있는가?
- RQ4다중 시점 감독이 없는 상황에서 온라인 가짜 시점 증강이 3D 가우시안 최적화를 어떻게 향상시킬 수 있는가?
- RQ5실제 모바일로 촬영한 데이터에서 제안된 방법은 최신 기술 수준의 NeRF 및 3D-GS 기반 기준과 비교해 렌더링 품질과 속도 면에서 어떻게 성과를 내는가?
주요 결과
- FSGS는 203 FPS의 렌더링 속도를 달성하여 SparseNeRF 대비 2900배 빠른 성능을 보이며 소비자 하드웨어에서도 실시간 추론이 가능하다.
- 단지 세 장의 학습 시점만 있는 모바일 촬영 데이터셋에서 FSGS는 PSNR 19.54와 SSIM 0.539를 기록하여 모든 기준 대비 뛰어난 성능을 보였다.
- FSGS는 SSIM을 SparseNeRF 대비 0.684에서 0.745로 향상시켜 빌드된 시각 품질 향상의 명확한 성과를 보였다.
- 3D-GS보다 더 선명한 깊이 맵과 더 세밀한 기하학적 세부 정보를 생성하며, 원거리 영역에서 과도하게 부드럽게 만드는 경향이 있는 3D-GS와 대비된다.
- 가짜 시점을 통한 깊이 사전 지식 통합으로 앨리어싱 아티팩트가 감소하고 기하학적 연속성이 향상되어 특히 관측되지 않은 영역에서 유의미한 개선이 이루어졌다.
- FSGS는 FreeNeRF와 SparseNeRF보다 깊이 품질 면에서 뛰어나며, 더 적은 아티팩트와 더 나은 복잡한 시점 구조의 재구성 능력을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.