[논문 리뷰] NeRF-SOS: Any-View Self-supervised Object Segmentation on Complex Scenes
NeRF-SOS는 공동 대비 손실을 통해 외관과 기하학적 특징을 동시에 활용함으로써, 다양한 실제 환경에서의 3D 객체 분할을 위한 자기지도 학습 프레임워크를 제안한다. 이는 NeRF 기반 객체 분할 분야에서 최신 기술을 초월하며, 분할 정확도와 시점 일관성 측면에서 2D 자기지도 학습 방법 및 지도 학습 대비 superior한 성능을 달성한다.
Neural volumetric representations have shown the potential that Multi-layer Perceptrons (MLPs) can be optimized with multi-view calibrated images to represent scene geometry and appearance, without explicit 3D supervision. Object segmentation can enrich many downstream applications based on the learned radiance field. However, introducing hand-crafted segmentation to define regions of interest in a complex real-world scene is non-trivial and expensive as it acquires per view annotation. This paper carries out the exploration of self-supervised learning for object segmentation using NeRF for complex real-world scenes. Our framework, called NeRF with Self-supervised Object Segmentation NeRF-SOS, couples object segmentation and neural radiance field to segment objects in any view within a scene. By proposing a novel collaborative contrastive loss in both appearance and geometry levels, NeRF-SOS encourages NeRF models to distill compact geometry-aware segmentation clusters from their density fields and the self-supervised pre-trained 2D visual features. The self-supervised object segmentation framework can be applied to various NeRF models that both lead to photo-realistic rendering results and convincing segmentation maps for both indoor and outdoor scenarios. Extensive results on the LLFF, Tank & Temple, and BlendedMVS datasets validate the effectiveness of NeRF-SOS. It consistently surpasses other 2D-based self-supervised baselines and predicts finer semantics masks than existing supervised counterparts. Please refer to the video on our project page for more details:https://zhiwenfan.github.io/NeRF-SOS.
연구 동기 및 목표
- 밀도 있는 또는 시점별 애너테이션 없이도 복잡한 실제 환경에서 자기지도 학습 기반 3D 객체 분할을 가능하게 하기 위해.
- 기존 방법이 고비용 인간 애너테이션 데이터나 합성 데이터에 의존하는 한계를 극복하기 위해.
- 2D 자기지도 시각적 특징과 NeRF의 3D 기하학적 정보를 통합하여 견고하고 시점 일관성이 높은 분할을 가능하게 하기 위해.
- 실내, 실외, 객체 중심 환경을 포함한 다양한 NeRF 변형에 적용 가능한 일반화된 프레임워크를 개발하기 위해.
제안 방법
- 객체 분할을 위한 외관 수준과 기하학 수준의 지도를 동시에 최적화하는 공동 대비 손실을 제안한다.
- 자기지도 2D 시각 기반 모델(예: DINO-ViT)을 활용해 외관 특징을 추출하고, 다양한 시점에서 압축된 분할 클러스터를 형성한다.
- NeRF의 밀도 필드를 활용해 3D 구조적 인식을 분할 클러스터에 통합하는 기하학적 인식 대비 손실을 도입한다.
- 이중 단계 학습 전략을 적용: 먼저 NeRF를 사전 학습하고, 이후 대비 손실을 통해 분할 헤드를 미세 조정함으로써 최적화 갈등을 방지한다.
- 압축된 분할 특징 공간에 비지도 클러스터링을 적용하여 최종 객체 마스크를 생성한다.
- 다양한 데이터셋에서 일반 NeRF, NeRF++, 기타 NeRF 변형에 대해 엔드 투 엔드 학습을 지원한다.
실험 결과
연구 질문
- RQ1시점별 애너테이션 없이도 자기지도 2D 시각적 특징이 NeRF 기반 3D 객체 분할에 효과적으로 활용될 수 있는가?
- RQ2NeRF의 내재된 3D 기하학(밀도 필드를 통해)을 어떻게 활용하여 분할의 일관성과 정확도를 향상시킬 수 있는가?
- RQ3외관과 기하학적 특징을 통합한 공동 대비 손실이 단일 모odal 지도 학습보다 분할 성능에서 뛰어나게 되는가?
- RQ4제안된 프레임워크는 무한대의 실외 환경을 포함한 다양한 실제 환경에 일반화될 수 있는가?
- RQ5NeRF와 대비 손실을 동시에 최적화하는 것과 비교해 이중 단계 학습 전략이 렲링 및 분할 정확도 측면에서 어떤가?
주요 결과
- LLFF, BlendedMVS, CO3Dv2, Tank & Temples 데이터셋에서 NeRF-SOS는 최신 2D 기반 자기지도 객체 공분할 방법보다 일관되게 뛰어난 성능을 보였다.
- CO3Dv2 데이터셋에서 NeRF-SOS는 mIoU 0.9686을 달성하여 지도 학습 기반 Semantic-NeRF 기준보다 뚜렷이 뛰어났다.
- NeRF++의 무한대 환경인 Truck 시나리오에서, NeRF-SOS는 지도 학습 기반 Semantic-NeRF++보다 더 세밀한 분할을 제공했으며, 옆 거울이나 슬랫 사이의 간극과 같은 작은 구조적 세부 정보를 정확히 식별했다.
- 절단 실험 결과, 외관 또는 기하학적 대비 손실을 제거할 경우 분할 클러스터가 분리되거나 일관성이 떨어지는 것으로 나타나, 두 구성 요소 모두의 필요성을 확인했다.
- NeRF와 대비 손실을 동시에 최적화할 경우, 렌더링 및 분할 성능이 떨어지므로, 최적화 안정성을 확보하기 위해 이중 단계 학습 전략이 필수적임을 입증했다.
- DINO-ViT를 2D 기반 모델로 사용할 경우 ResNet50 대비 더 뛰어난 분할 정확도를 달성했으며, ViT 기반 자기지도 특징이 3D 환경 이해에 유리함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.