[논문 리뷰] MonoSDF: Exploring Monocular Geometric Cues for Neural Implicit Surface Reconstruction
MonoSDF는 단안(depth) 및 노멀 신호를 신경 암묵 표면 재구성에 통합하여 다양한 장면과 표현(MLP 및 그리드 기반)에서 정확도와 수렴성을 향상시킵니다.
In recent years, neural implicit surface reconstruction methods have become popular for multi-view 3D reconstruction. In contrast to traditional multi-view stereo methods, these approaches tend to produce smoother and more complete reconstructions due to the inductive smoothness bias of neural networks. State-of-the-art neural implicit methods allow for high-quality reconstructions of simple scenes from many input views. Yet, their performance drops significantly for larger and more complex scenes and scenes captured from sparse viewpoints. This is caused primarily by the inherent ambiguity in the RGB reconstruction loss that does not provide enough constraints, in particular in less-observed and textureless areas. Motivated by recent advances in the area of monocular geometry prediction, we systematically explore the utility these cues provide for improving neural implicit surface reconstruction. We demonstrate that depth and normal cues, predicted by general-purpose monocular estimators, significantly improve reconstruction quality and optimization time. Further, we analyse and investigate multiple design choices for representing neural implicit surfaces, ranging from monolithic MLP models over single-grid to multi-resolution grid representations. We observe that geometric monocular priors improve performance both for small-scale single-object as well as large-scale multi-object scenes, independent of the choice of representation.
연구 동기 및 목표
- 다중 뷰 신호가 제한되거나 텍스처가 없는 상황에서도 견고한 3D 재구성을 촉진합니다.
- 단안 깊이 및 노멀 예측이 신경 암묵 표면을 제약하는 방법을 조사합니다.
- 신경 암묵 표현(MLP, 조밀 그리드, 단일/다중 해상도 그리드)을 체계적으로 비교합니다.
- 객체 수준 및 방/장면 규모 데이터셋에서 MonoSDF를 평가하여 확장성 및 효율성을 평가합니다.
제안 방법
- 장면 기하를 Dense SDF 그리드, 단일 MLP, 단일 해상도 특성 그리드, 다중 해상도 특성 그리드의 4가지 옵션으로 매개변수화된 SDF로 표현합니다.
- 렌더링은 미분가능한 체적 렌더링을 통해 최적화를 위한 RGB, 깊이 및 법선을 얻습니다.
- 사전 학습된 Omnidata 모델로 단안 신호(depth 및 normals)를 예측하고 이를 감독 신호로 사용합니다.
- RGB 재구성, Eikonal 정규화, 깊이 일관성, 노멀 일관성을 배치별 스케일/이동 정렬과 함께 손실로 정의합니다.
- Cue-enhanced losses를 사용하여 Adam으로 장면 표현과 외관을 공동 최적화합니다.
실험 결과
연구 질문
- RQ1텍스처가 희박하거나 다중 객체가 있는 장면에서도 단안 깊이와 노멀 큐가 신경 암묵 표면 재구성에 도움이 되나요?
- RQ2어떤 신경 암묵 표현(MLP 대 그리드 기반)이 품질과 수렴 속도 측면에서 단안 사전 정보로 가장 큰 이점을 얻나요?
- RQ3깊이 및 노멀 사전이 RGB 기반 감독과 서로 어떻게 상호작용하고 보완하여 다양한 장면 규모에서 효과를 발휘하나요?
주요 결과
- 단안 큐는 MLP와 다중 해상도 그리드 모두에 대해 재구성 품질을 크게 향상시키며, 깊이와 노멀 큐를 함께 사용할 때 최상의 결과를 얻습니다.
- Replica의 큐가 없는 경우 그리드 기반 표현 중 다중 해상도 그리드가 타 아키텍처보다 우수하지만, 큐를 사용할 때 두 구조 모두 향상되고 수렴 속도가 증가합니다.
- 단일 MLP가 다수의 도전적인 설정에서 그리드보다 느리게 수렴하더라도 전반적으로 가장 강한 성능을 달성합니다.
- ScanNet에서 MLP 변형은 벤치마크를 능가하며 더 매끄러운 재구성과 더 많은 디테일을 제공합니다.
- DTU 희소 시야 실험은 큐가 MLP와 그리드 모두에서 강력한 성능을 가능하게 함을 보여주며, 밀집 시야에서 그리드가 큐로 인해 더 큰 이점을 얻습니다.
- 다중 모달 평가에서 단안 사전은 객체-, 방-, 장면 수준의 데이터에 걸쳐 확장 가능하고 견고한 재구성을 가능하게 합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.