[논문 리뷰] MonoNeuralFusion: Online Monocular Neural 3D Reconstruction with Geometric Priors
MonoNeuralFusion은 볼륨 렌더링을 사용하는 신경 암시적 장면 표현과 기하학적 사전 지식(표면 법선, 아이케오날 정규화, 노멀 매핑)을 통한 가이드를 통해 온라인 단일 카메라 3D 재구성 방법을 제안한다. 이는 높은 정밀도의 세밀한 기하 구조 재구성을 달성한다. 기하학적 사전 지식을 암시적 표현과 볼륨 렌더링 최적화에 통합함으로써 실시간 스캐닝 중에 효율적이고 점진적인 표면 정밀화를 가능하게 하며, 최적화 없이도 최신 기술들을 능가하는 완전성과 세부 정보 유지 능력을 확보한다.
High-fidelity 3D scene reconstruction from monocular videos continues to be challenging, especially for complete and fine-grained geometry reconstruction. The previous 3D reconstruction approaches with neural implicit representations have shown a promising ability for complete scene reconstruction, while their results are often over-smooth and lack enough geometric details. This paper introduces a novel neural implicit scene representation with volume rendering for high-fidelity online 3D scene reconstruction from monocular videos. For fine-grained reconstruction, our key insight is to incorporate geometric priors into both the neural implicit scene representation and neural volume rendering, thus leading to an effective geometry learning mechanism based on volume rendering optimization. Benefiting from this, we present MonoNeuralFusion to perform the online neural 3D reconstruction from monocular videos, by which the 3D scene geometry is efficiently generated and optimized during the on-the-fly 3D monocular scanning. The extensive comparisons with state-of-the-art approaches show that our MonoNeuralFusion consistently generates much better complete and fine-grained reconstruction results, both quantitatively and qualitatively.
연구 동기 및 목표
- 단일 영상에서의 부정확하고 과도하게 매끄러운 3D 재구성 문제를 해결하기 위해, 특히 세밀한 기하 구조 정보를 정확히 포착하는 데 초점을 맞춘다.
- 실시간 응용에 적합한 효율적인 온라인 재구성 시스템을 개발하여 스캐닝 중에 점진적으로 3D 기하 구조를 구축하고 정밀화한다.
- 표면 법선과 아이케오날 정규화와 같은 기하학적 사전 지식을 신경 암시적 표현과 볼륨 렌더링에 통합하여 기하 구조의 정밀도를 향상시킨다.
- 깊이 맵이나 단순한 특징 융합에 의존하는 기존 방법의 한계를 극복하며, 이는 일반적으로 흐릿하거나 세부 정보가 손실되는 결과를 초래한다.
- 특수한 최적화 없이도 사전에 학습된 가중치를 사용하여 고품질의 재구성을 가능하게 하여 실용적 구현을 향상시킨다.
제안 방법
- 연속적인 부호화된 거리 함수(SDF)로 디코딩되는 희소 특징 볼륨으로서 신경 암시적 장면 표현(NISR)을 수립함으로써, 민감하고 세밀한 기하 구조 인코딩이 가능해진다.
- 볼륨 렌더링에서 계층적 샘플링 전략을 도입하여 레이가 점유된 희소 볼륨 내에서만 샘플링되도록 하여 렌더링의 효율성과 정확도를 향상시킨다.
- NISR 학습과 볼륨 렌더링 최적화에 표면 법선 사전 지식, 아이케오날 정규화, 노멀 매핑 사전 지식을 통합하여 기하 구조 세부 정보 학습을 향상시킨다.
- 예측된 노멀 매핑과 색상 일관성에 기반한 온라인 볼륨 렌더링 최적화 단계를 도입하여, 재구성의 재현율과 세부 정보를 향상시킨다.
- 이중 단계 최적화를 활용한다: 스캐닝 중 점진적인 온라인 정밀화와 스캔 후 짧은 장면별 정밀 조정을 통해 품질을 추가로 향상시킨다.
- ScanNet 데이터셋에서 사전 학습된 가중치를 활용하여 새로운 장면에 그대로 적용하고 추가 최적화 없이도 빠른 배포를 가능하게 한다.
실험 결과
연구 질문
- RQ1기하학적 사전 지식이 단일 영상에서의 세밀한 기하 구조 재구성 향상에 효과적으로 통합될 수 있는가?
- RQ2실시간으로 볼륨 렌더링을 최적화하여 온라인 재구성 중 기하 구조 세부 정보를 어떻게 향상시킬 수 있는가?
- RQ3희소 특징 볼륨 표현이 해상도 의존적인 SDF보다 세밀한 세부 정보를 효과적으로 포착하면서도 계산 효율성을 유지할 수 있는가?
- RQ4사전에 학습된 신경 표현이 최적화 없이도 새로운 장면으로 일반화될 수 있는 정도는 어느 정도이며, 특히 온라인 환경에서의 성능은 어떠한가?
- RQ5기하학적 사전 지식이 얇은 부분이나 거울과 같은 도전적인 영역에서 재구성된 표면의 일관성과 완전성에 어떤 영향을 미치는가?
주요 결과
- MonoNeuralFusion은 다양한 벤치마크에서 최신 기술을 능가하는 재구성 품질을 달성하였으며, 정량적 지표와 시각적 정확도 모두에서 기존의 온라인 단일 카메라 방법을 크게 앞서간다.
- 기하학적 사전 지식, 특히 노멀 매핑 예측의 통합은 소파의 틈새나 의자 다리와 같은 표면 세부 정보에서 뚜렷한 향상이 이루어졌으며, 정성적 비교에서 확인되었다.
- 볼륨 렌더링 최적화로 F-스코어와 재현율이 향상되었으며, 컴퓨터 디스플레이나 계단과 같은 누락된 영역을 메우는 데 특히 효과적이었다. 그림 10에서 이를 입증하였다.
- 사전에 학습된 ScanNet의 가중치만을 사용하여도 고품질의 재구성을 달성하였으며, 이는 강력한 일반화 능력을 시사한다.
- 최적화에 색상 표현을 추가함으로써 노멀 매핑만으로는 달성할 수 없는 더 높은 수준의 시각적 세부 정보가 향상되었으며, 그림 11에서 이를 확인하였다.
- 다시 말해, 개선된 성능에도 불구하고 거울 재구성, 일관성 없는 법선 예측, 얇거나 복잡한 부분에서 여전히 어려움을 겪고 있어未래 개선이 필요한 분야로 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.