[논문 리뷰] Neural Sparse Voxel Fields
Neural Sparse Voxel Fields (NSVF)는 고해상도, 고속의 자유 시점 렌더링을 위한 로컬 암시적 필드를 정렬하기 위해 희소 벡셀 오кт리 구조를 사용하는 하이브리드 신경 장면 표현을 제안한다. 희소 벡셀 정점에서의 벡셀 임베딩을 학습하고, 미분 가능한 레이 마칭을 적용함으로써 NSVF는 NeRF보다 10배 이상 빠른 추론 속도를 달성하면서도 더 높은 품질, 더 선명한 렌더링을 제공하며 편집 가능성과 동적 및 대규모 장면에 대한 확장성도 향상시킨다.
Photo-realistic free-viewpoint rendering of real-world scenes using classical computer graphics techniques is challenging, because it requires the difficult step of capturing detailed appearance and geometry models. Recent studies have demonstrated promising results by learning scene representations that implicitly encode both geometry and appearance without 3D supervision. However, existing approaches in practice often show blurry renderings caused by the limited network capacity or the difficulty in finding accurate intersections of camera rays with the scene geometry. Synthesizing high-resolution imagery from these representations often requires time-consuming optical ray marching. In this work, we introduce Neural Sparse Voxel Fields (NSVF), a new neural scene representation for fast and high-quality free-viewpoint rendering. NSVF defines a set of voxel-bounded implicit fields organized in a sparse voxel octree to model local properties in each cell. We progressively learn the underlying voxel structures with a differentiable ray-marching operation from only a set of posed RGB images. With the sparse voxel octree structure, rendering novel views can be accelerated by skipping the voxels containing no relevant scene content. Our method is typically over 10 times faster than the state-of-the-art (namely, NeRF(Mildenhall et al., 2020)) at inference time while achieving higher quality results. Furthermore, by utilizing an explicit sparse voxel representation, our method can easily be applied to scene editing and scene composition. We also demonstrate several challenging tasks, including multi-scene learning, free-viewpoint rendering of a moving human, and large-scale scene rendering. Code and data are available at our website: https://github.com/facebookresearch/NSVF.
연구 동기 및 목표
- 기존의 신경 암시적 표현의 한계, 즉 뿌연 렌더링과 고밀도 체적 샘플링 및 제한된 네트워크 용량으로 인한 느린 추론을 해결하기 위해.
- 명시적인 3D 지도 없이도, 오직 정렬된 2D RGB 이미지로부터 효율적이고 고해상도의 새로운 시점 렌더링을 가능하게 하기 위해.
- 명시적인 희소 벡셀 구조를 활용하여 실용적인 장면 편집 및 조합을 가능하게 하기 위해.
- 움직이는 인간과 다중 장면 학습을 포함한 도전적인 동적 및 대규모 장면에 신경 렌더링을 확장하기 위해.
- 희소 벡셀 오кт리에서의 미분 가능한 점진적 학습 전략을 통해 공백 벡셀을 건너뛰어 렌더링 속도를 가속화하기 위해.
제안 방법
- NSVF는 각 활성 벡셀이 그 여덟 개 정점에서 학습된 임베딩을 저장하여 국소 기하학적 구조와 외관을 표현하는 희소 벡셀 오кт리로 장면를 구성한다.
- 다층 퍼셉트론(MLP)이 벡셀 정점 임베딩을 집계하여, 해당 벡셀 내 임의의 쿼리 포인트의 색상과 밀도를 예측한다.
- 정렬된 2D 이미지에서부터 끝내는 학습이 가능한, 미분 가능한 레이 마칭 연산을 적용한다. 이는 점진적으로 정밀해지는 희소 벡셀 구조를 개선한다.
- 학습 중에는 장면 내용이 없는 벡셀이 제거되어, 네트워크가 실제 기하학적 구조와 외관이 존재하는 영역에 집중할 수 있다.
- 추론 시에는 공백 벡셀을 건너뛰어 렌더링 속도를 크게 향상시킨다.
- 희소 벡셀 구조는 특정 벡셀 영역에 국한된 수정이 가능하므로, 효율적인 장면 편집 및 조합을 가능하게 한다.
실험 결과
연구 질문
- RQ1희소 벡셀 기반의 신경 표현은 NeRF와 같은 고밀도 암시적 표현보다 더 높은 렌더링 품질과 더 빠른 추론 속도를 달성할 수 있는가?
- RQ2희소 벡셀 오кт리 위에서의 미분 가능한 레이 마칭은 3D 지도 없이도 오직 2D 이미지에서 점진적이고 끝내는 학습을 가능하게 하는가?
- RQ3명시적인 희소 벡셀 구조는 실용적인 장면 편집 및 조합 작업을 지원할 수 있는가?
- RQ4NSVF는 움직이는 장면, 다중 장면 학습, 대규모 환경 등 도전적인 상황에 확장 가능한가?
- RQ5벡셀 기반의 암시적 필드 설계는 표준 신경 암시적 함수에 비해 뿌연 현상 감소와 기하학적 정확도 향상을 이룰 수 있는가?
주요 결과
- NSVF는 최신 기술인 NeRF보다 10배 이상 더 빠른 추론 속도를 확보하면서도 더 높은 품질, 더 선명한 렌더링을 제공한다.
- 메모리 할당 및 정확한 레이-기하 구조 교차점을 통한 네트워크 용량 최적화로 인해, 더 낮은 뿌연 현상과 향상된 렌더링 품질을 입증한다.
- 공백 벡셀을 건너뛰는 방식으로 효율적인 렌더링이 가능하여, 시각적 정확도를 유지하면서도 뚜렷한 속도 향상을 이룬다.
- 단일 이미지 세트로부터도 움직이는 인간의 자유 시점 렌더링 및 대규모 장면 복원과 같은 복잡한 작업을 지원한다.
- 희소 벡셀 구조는 특정 장면 영역을 조작할 수 있는 직관적인 장면 편집 및 조합을 가능하게 한다.
- 다중 장면 학습에 잘 일반화되며, 다양한 실내 및 실외 장면에서 높은 성능 유지를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.