[논문 리뷰] GNeSF: Generalizable Neural Semantic Fields
이 논문은 2D 감독만으로도 새로운 환경에 대해 일반화 가능한 신경적 의미 장(field)인 GNeSF를 제안한다. 다중 시야 이미지 특징, 시야 간 차이를 반영한 소프트 보팅 메커니즘, 그리고 가시성 모듈을 활용함으로써 GNeSF는 각 환경에 맞는 최적화를 필요로 하지 않으며, 오직 2D 애너테이션만으로도 최신 기술 수준의 성능을 달성한다. 이는 3D 감독이 필요한 기존 방법들을 능가한다.
3D scene segmentation based on neural implicit representation has emerged recently with the advantage of training only on 2D supervision. However, existing approaches still requires expensive per-scene optimization that prohibits generalization to novel scenes during inference. To circumvent this problem, we introduce a generalizable 3D segmentation framework based on implicit representation. Specifically, our framework takes in multi-view image features and semantic maps as the inputs instead of only spatial information to avoid overfitting to scene-specific geometric and semantic information. We propose a novel soft voting mechanism to aggregate the 2D semantic information from different views for each 3D point. In addition to the image features, view difference information is also encoded in our framework to predict the voting scores. Intuitively, this allows the semantic information from nearby views to contribute more compared to distant ones. Furthermore, a visibility module is also designed to detect and filter out detrimental information from occluded views. Due to the generalizability of our proposed method, we can synthesize semantic maps or conduct 3D semantic segmentation for novel scenes with solely 2D semantic supervision. Experimental results show that our approach achieves comparable performance with scene-specific approaches. More importantly, our approach can even outperform existing strong supervision-based approaches with only 2D annotations. Our source code is available at: https://github.com/HLinChen/GNeSF.
연구 동기 및 목표
- 기존의 신경적 의미 장이 각 환경에 맞는 최적화를 필요로 하여 새로운 환경으로의 일반화가 제한되는 문제를 해결하기 위해.
- 재학습이나 3D 감독 없이도 새로운 환경에 대해 고품질의 3D 의미 분할을 가능하게 하기 위해.
- 장면 고유의 기하학적 및 의미적 특징에 과적합되는 것을 방지함으로써 일반화 능력을 향상시키기 위해.
- 2D 의미 맵과 다중 시야 특징을 활용하여 강력한 3D 의미 예측을 가능하게 하는 프레임워크를 개발하기 위해.
제안 방법
- 장면 고유의 기하학적 및 의미적 특징에 과적합되는 것을 방지하기 위해 위치 인코딩 대신 다중 시야 이미지 특징을 사용한다.
- 다양한 시야에서 유도된 2D 의미 확률을 소프트 보팅 메커니즘을 통해 통합하여 3D 점의 의미를 예측하며, 이때 시야의 관련성에 따라 가중치를 적용한다.
- 보팅 과정에서 가까운 시야를 먼 시야보다 우선시하기 위해 시야 간 차이를 반영한 인코딩 기법을 도입한다.
- 가시성 모듈을 통해 가려진 또는 신뢰할 수 없는 시야에서 유도된 의미 정보를 탐지하고 필터링한다.
- 기하학적 인코딩 볼륨 내에서의 특징 보간을 통해 3D MLP를 통해 3D 기하학적 구조(밀도 또는 SDF)를 예측한다.
- 최종 의미 예측은 예측된 기하학적 정보에서 유도된 가중치를 적용한 투영된 2D 의미의 가중 조합으로 계산된다.
실험 결과
연구 질문
- RQ1각 환경에 맞는 최적화 없이도 일반화 가능한 신경적 의미 장을 훈련시킬 수 있는가?
- RQ23D 애너테이션 없이도 2D 의미 감독을 효과적으로 활용하여 3D 의미 장을 예측할 수 있는가?
- RQ3다중 시야 의미 정보를 3D 예측에 통합할 때 시야 간 거리의 역할은 무엇인가?
- RQ4가시성 모듈이 가려진 시야 기여를 필터링함으로써 정확도를 향상시킬 수 있는가?
- RQ5위치 인코딩 대신 이미지 특징을 사용할 경우 일반화 능력과 성능에 어떤 영향을 미치는가?
주요 결과
- GNeSF는 Replica 데이터셋에서 3D mIoU 43.8%를 달성하여, 오직 2D 감독만을 사용하는 모든 이전 방법들을 능가한다.
- ScanNet에서 GNeSF는 55.1% mIoU를 기록하여, 3D 감독을 사용하는 이전 최고 성능 방법(51.5%)을 초월한다.
- 제거 실험 결과, 가시성 모듈을 추가함으로써 기준 모델 대비 mIoU가 0.9% 향상되어 그 효과를 확인하였다.
- 원시 로짓 대비 확률 분포를 사용할 경우, 로짓 기반 보팅 대비 mIoU가 0.6% 향상되어 성능 향상을 입증하였다.
- S4R(36.9% mIoU)에 비해 뚜렷한 성능 향상을 보이며, GNeSF의 소프트 보팅 메커니즘이 우월함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.