Skip to main content
QUICK REVIEW

[논문 리뷰] In-Place Scene Labelling and Understanding with Implicit Scene Representation

Shuaifeng Zhi, Tristan Laidlow|arXiv (Cornell University)|2021. 03. 29.
Advanced Vision and Imaging참고 문헌 31인용 수 12
한 줄 요약

이 논문은 희소하거나 노이즈가 있는 현장 내 레이블만을 사용하여 3D 기하학, 복사율, 그리고 의미를 동시에 인코딩하는 시나리오 특화 신경 은닉 표현인 Semantic-NeRF를 제안한다. NeRF의 다중 뷰 일致성과 부드러움을 활용하여, 최소한의 감독 하에 고품질의 2D 의미 레이블링, 레이블 노이즈 제거, 초해상도 처리, 다중 뷰 융합을 가능하게 한다 — 레이블이 10%인 경우 mIoU가 88.4%에 도달한다.

ABSTRACT

Semantic labelling is highly correlated with geometry and radiance reconstruction, as scene entities with similar shape and appearance are more likely to come from similar classes. Recent implicit neural reconstruction techniques are appealing as they do not require prior training data, but the same fully self-supervised approach is not possible for semantics because labels are human-defined properties. We extend neural radiance fields (NeRF) to jointly encode semantics with appearance and geometry, so that complete and accurate 2D semantic labels can be achieved using a small amount of in-place annotations specific to the scene. The intrinsic multi-view consistency and smoothness of NeRF benefit semantics by enabling sparse labels to efficiently propagate. We show the benefit of this approach when labels are either sparse or very noisy in room-scale scenes. We demonstrate its advantageous properties in various interesting applications such as an efficient scene labelling tool, novel semantic view synthesis, label denoising, super-resolution, label interpolation and multi-view semantic label fusion in visual semantic mapping systems.

연구 동기 및 목표

  • 완전한 레이블링이 불가능한 새로운, 미리 보지 않은 환경에서 정확한 3D 의미 시나리오 이해를 가능하게 하기 위해.
  • NeRF의 기하학적 및 광학적 사전 지식을 활용하여 희소하거나 노이즈가 있는 감독 하에 의미 레이블링을 향상시키기 위해.
  • 사전 학습 모델이나 대규모 데이터셋이 필요 없이 기하학, 외관, 의미를 동시에 학습하는 자기지도 학습 기반의 시나리오 특화 방법을 개발하기 위해.
  • 인터랙티브 레이블링, 레이블 노이즈 제거, 초해상도 처리, 다중 뷰 의미 융합과 같은 실용적 응용을 보여주기 위해.
  • 암시적 신경 표현이 약한 감독만으로도 뷰 간에 의미 레이블을 효과적으로 전파할 수 있는지 입증하기 위해.

제안 방법

  • 단일 암시적 3D 표현 내에서 기하학, 복사율, 의미 클래스 확률을 동시에 예측할 수 있도록 신경 복사율 장치(NeRF)에 추가적인 의미 헤드를 도입한다.
  • 기하학적 감독 없이, 같은 시나리오의 포즈가 설정된 RGB 이미지와 희소하거나 노이즈가 있는 의미 레이블을 사용하여 네트워크를 엔드 투 엔드로 훈련시킨다.
  • NeRF의 암시적 3D 표현에서 유도되는 다중 뷰 일치성과 자기 유사성 특성을 활용하여 레이블을 효율적으로 뷰 간에 전파한다.
  • 다중 뷰 간의 광학 일치성을 통해 가시화 가능한 손실을 이용하여 의미 예측을 감독한다.
  • NeRF의 볼륨 렌더링 손실과 의미 교차 엔트로피, 일致성 정규화를 결합한 다중 작업 손실을 적용한다.
  • 전체 시나리오를 하나의 암시적 MLP로 표현하여 고해상도, 연속적인 의미 레이블링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일 암시적 신경 표현이 기하학, 외관, 의미를 동시에 모델링하여 최소한의 감독 하에 정확한 의미 레이블링을 가능하게 할 수 있는가?
  • RQ2희소하거나 노이즈가 있는 의미 레이블을 다중 뷰 간에 전파하는 데 있어 암시적 3D 표현의 효과는 어떠한가?
  • RQ3NeRF의 기하학적 및 광학적 사전 지식이 개방형, 실제 세계의 시나리오에서 의미 분할 성능을 얼마나 향상시킬 수 있는가?
  • RQ4정답 깊이 정보가 없는 조건에서, 공동 표현이 깊이 기반 다중 뷰 융합 방법을 능가할 수 있는가?
  • RQ5레이블의 농도와 품질이 제안된 프레임워크에서 의미 레이블 전파 성능에 얼마나 영향을 미치는가?

주요 결과

  • 각 의미 클래스당 하나의 레이블만 있는 조건에서, 평균 교차율(mIoU)이 60.2%에 도달하여 극히 적은 감독 하에서도 강력한 일반화 능력을 입증한다.
  • 레이블링 비율을 클래스당 10%로 증가시키면 mIoU가 88.4%로 상승하여 적은 레이블링 노력으로도 성능 향상이 뚜렷하게 나타난다.
  • 다중 뷰 의미 융합에서 68.0%의 mIoU를 달성하여, 정답 깊이 정보를 사용하는 베이지안 및 평균 융합 기반 방법보다도 뛰어난 성능을 보였다.
  • 부드럽고 일관된 암시적 표현을 활용하여 저품질 또는 해상도가 낮은 레이블을 정제함으로써 레이블 노이즈 제거 및 초해상도 처리를 효과적으로 달성한다.
  • 정확한 새로운 뷰 합성과 함께 의미 레이블을 유지하여 다양한 카메라 자세에서도 미세한 구조와 객체 경계를 잘 보존한다.
  • 모델이 의미 모호성을 해결하기 위해 가장 정보가 많은 레이블을 식별하고 요청할 수 있도록 상호작용 레이블링을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.