Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Multi-View Object Segmentation Using Radiance Field Propagation

Xinhang Liu, Jiaben Chen|arXiv (Cornell University)|2022. 10. 02.
Computer Graphics and Visualization Techniques인용 수 6
한 줄 요약

이 논문은 신경 영역장(nerve radiance fields)을 활용하여 다중 시점 3D 객체 분할을 위한 비지도 학습 방법인 라디안스 필드 전파(Radiance Field Propagation, RFP)를 제안한다. 이 방법은 이중 방향 광학 손실을 통해 의미 필드 학습을 자율적으로 지도하며, 애너테이션 또는 사전 객체 지식 없이도 3D 장면 분할에서 최신 기술 수준(SOTA)의 비지도 성능을 달성한다. 또한, 레이어드된 3D 객체의 렌더링 및 편집도 가능하다.

ABSTRACT

We present radiance field propagation (RFP), a novel approach to segmenting objects in 3D during reconstruction given only unlabeled multi-view images of a scene. RFP is derived from emerging neural radiance field-based techniques, which jointly encodes semantics with appearance and geometry. The core of our method is a novel propagation strategy for individual objects' radiance fields with a bidirectional photometric loss, enabling an unsupervised partitioning of a scene into salient or meaningful regions corresponding to different object instances. To better handle complex scenes with multiple objects and occlusions, we further propose an iterative expectation-maximization algorithm to refine object masks. RFP is one of the first unsupervised approach for tackling 3D real scene object segmentation for neural radiance field (NeRF) without any supervision, annotations, or other cues such as 3D bounding boxes and prior knowledge of object class. Experiments demonstrate that RFP achieves feasible segmentation results that are more accurate than previous unsupervised image/scene segmentation approaches, and are comparable to existing supervised NeRF-based methods. The segmented object representations enable individual 3D object editing operations.

연구 동기 및 목표

  • 애너테이션, 3D 경계 상자, 또는 클래스 사전 지식 없이도 비지도로 다중 시점 3D 객체 분할을 수행하는 도전 과제를 해결하기 위해.
  • 신경 영역장 내 3D 기하학적 및 외관 일관성을 활용하여 자율적 의미 필드 학습을 수행하기 위해.
  • 차폐 및 다수의 객체가 존재하는 복잡한 장면에서도 정확하고 일관된 3D 객체 분할을 가능하게 하기 위해.
  • 다중 시점 이미지만을 사용하여 개별 3D 객체의 렌더링 및 편집을 가능하게 하는 후속 응용을 지원하기 위해.
  • 2D 기반 분할의 한계를 극복하기 위해 3D 장면 표현 및 볼륨 렌더링을 활용하기 위해.

제안 방법

  • 이 방법은 각 객체와 배경을 별개의 영역장으로 모델링하는 계층적 장면 표현을 사용한다.
  • 객체 영역에서 비롯된 외관 통계를 비객체 영역으로 전파하는 새로운 라디안스 필드 전파 전략을 도입하여 의미 필드 학습을 유도한다.
  • 잘못 렌더링된 이미지의 오차를 최대화하고, 올바르게 렌더링된 이미지의 오차를 최소화함으로써 자율적 지도 학습을 가능하게 하기 위해 이중 방향 광학 손실을 제안한다.
  • 다중 객체 및 차폐가 존재하는 장면에서 객체 마스크를 개선하기 위해 반복적인 기대값 최대화(EM) 알고리즘을 적용한다.
  • 학습 중에는 애너테이션 데이터를 사용하지 않으며, 사전 학습된 특징 추출기만을 초기화 목적으로 사용한다.
  • 최종 출력은 학습된 분할된 NeRF를 통해 자유 시점 렌더링 및 개별 3D 객체 편집을 가능하게 한다.

실험 결과

연구 질문

  • RQ1캘리브레이션된 카메라 자세와 애너테이션이 없는 다중 시점 이미지만을 사용하여 실생활 장면에서 3D 객체 분할을 수행할 수 있는가?
  • RQ2애너테이션 또는 사전 지식 없이도 3D 장면 이해에서 자율적 지도 학습을 효과적으로 활용할 수 있는가?
  • RQ3차폐가 존재하는 복잡한 장면에서 이중 방향 광학 손실을 활용한 라디안스 필드 전파가 분할 정확도를 향상시킬 수 있는가?
  • RQ4비지도 다중 시점 분할이 3D 장면 이해에서 기존의 비지도 2D 이미지 분할 방법보다 얼마나 뛰어나게 성능을 냈는가?
  • RQ5결과적으로 도출된 분할된 NeRF가 객체 복제, 이동, 회전과 같은 실용적인 3D 편집 작업을 지원할 수 있는가?

주요 결과

  • RFP는 표 1에 제시된 모든 지표에서 이전 비지도 방법들을 능가하며, 3D 다중 시점 객체 분할 분야에서 최신 기술 수준(SOTA)의 비지도 성능을 달성한다.
  • 새로운 시점 평가에서 RFP는 98.5%의 N-Acc와 94.1%의 N-mIoU를 기록하여 모든 비지도 방법을 초월한다.
  • 3D 인식 기반의 이중 방향 광학 손실 덕분에 기준선 대비 흐릿한 가장자리, 구멍, 오진 양성 결과가 크게 감소한다.
  • EM 기반의 정밀 조정은 다중 객체가 존재하는 복잡한 장면에서 마스크 품질을 향상시켜 더 선명하고 정확한 경계를 제공한다.
  • RFP는 애너테이션 없이도 고품질의 개별 객체 렌더링 및 자유 시점 편집(복제, 이동, 회전 포함)을 가능하게 한다.
  • 절단 실험을 통해 라디안스 필드 전파와 이중 방향 광학 손실이 견고한 성능을 내기 위해 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.